← terug naar overzicht

Gemini Omni 1.1 🎬, Cohere Parse πŸ“„, Codex persistente modus πŸ‘¨πŸ’»

samenvatting πŸ“… 2026-08-28
Veiligheidsbeoordeling is cruciaal om te bepalen of afgestemde grote taalmodellen (LLM's) robuust blijven tegen jailbreak-aanvallen. Bestaande geautomatiseerde testmethoden leunen echter grotendeels op feedback op responsniveau: elke kandidaat-prompt vereist doorgaans het genereren van een doelmodel-respons om de effectiviteit van de aanval te beoordelen. Dit proces is kostbaar en biedt bovendien slechts schaarse sturing bij sterk afgestemde modellen, waar de meeste kandidaten...

πŸ”— lees originele bron