"Als taalmodel...": chat-templateswitches veranderen de zelfreferentiële stem van een LLM en activeringssturing reproduceert die
arXiv:2609.25021v1 Aankondigingstype: nieuw Samenvatting: Grote taalmodellen (LLM's) hebben de neiging disclaimers toe te voegen zoals "ik ben maar een AI" wanneer hen iets wordt gevraagd over henzelf. De zelfrapportages uit zulke antwoorden worden gebruikt in debatten over AI-veiligheid of zelfkennis van de modellen, maar wat ze drijft is slecht begrepen. Vertellen de modellen ons iets over zichzelf of juist over hoe ze worden ingezet? In dit werk laten we zien dat de chat-template werkt als een schakelaar — wanneer die aanwezig is, zet hij deze onthulling aan
🔗 lees originele bron