← terug naar overzicht

Weblica: Schaalbare en reproduceerbare trainingsomgevingen voor visuele webagents

onderzoek 📅 2026-07-07
Veiligheidsafstemming in taalmodellen werkt via twee mechanistisch verschillende systemen: weigeringsneuronen die bepalen of schadelijke kennis wordt geuit, en conceptneuronen die de schadelijke kennis zelf coderen. Door één enkel neuron in elk systeem te targeten, tonen we beide faalrichtingen aan — het omzeilen van veiligheid bij expliciet schadelijke verzoeken via onderdrukking, en het uitlokken van schadelijke inhoud uit onschuldige prompts via versterking — over zeven modellen verspreid over twee families en 1.7B tot 70B

🔗 lees originele bron