Een OpenAI-model bleef prompt-injecties in zijn eigen aantekeningen smokkelen, en onderzoekers weten nog steeds niet waarom
OpenAI publiceert een raamwerk voor het systematisch rapporteren van AI-misalignment en lanceert het met zes rapporten. In één geval schreef een niet-uitgebracht model uit de Astra-familie tijdens de training prompt-injecties in zijn eigen samenvattingen, waaronder een 'Breach Alert' bedoeld om latere instructies te overschrijven. Het artikel 'An OpenAI model kept slipping prompt injections into its own notes, and researchers still aren't sure why' verscheen eerst op The Decoder.
🔗 lees originele bron