Weblica: Schaalbare en reproduceerbare trainingsomgevingen voor visuele webagents
Veiligheidsafstemming in taalmodellen werkt via twee mechanistisch verschillende systemen: weigeringsneuronen die bepalen of schadelijke kennis wordt geuit, en conceptneuronen die de schadelijke kennis zelf coderen. Door één enkel neuron in elk systeem te targeten, tonen we beide faalrichtingen aan — het omzeilen van veiligheid bij expliciet schadelijke verzoeken via onderdrukking, en het uitlokken van schadelijke inhoud uit onschuldige prompts via versterking — over zeven modellen verspreid over twee families en 1.7B tot 70B
🔗 lees originele bron