Gemini Omni 1.1 π¬, Cohere Parse π, Codex persistente modus π¨π»
Veiligheidsbeoordeling is cruciaal om te bepalen of afgestemde grote taalmodellen (LLM's) robuust blijven tegen jailbreak-aanvallen. Bestaande geautomatiseerde testmethoden leunen echter grotendeels op feedback op responsniveau: elke kandidaat-prompt vereist doorgaans het genereren van een doelmodel-respons om de effectiviteit van de aanval te beoordelen. Dit proces is kostbaar en biedt bovendien slechts schaarse sturing bij sterk afgestemde modellen, waar de meeste kandidaten...
π lees originele bron