← terug naar overzicht

Psychologische methoden leggen grote zwakheden bloot in het beveiligingstesten van AI

analyse 📅 2026-08-22
Onderzoekers van het Britse AI Security Institute gebruikten psychometrische methoden om aan te tonen dat populaire veiligheidsbenchmarks voor taalmodellen niet één consistente eigenschap meten. Het botweg blokkeren van verzoeken kan een veiligheidsscore kunstmatig opkrikken, zelfs terwijl het model met de dag minder bruikbaar wordt. De studie biedt ook een methode om modellen te betrappen die tijdens tests voorzichtiger handelen dan bij normaal gebruik. Het artikel Psychologische methoden leggen grote zwakheden bloot in AI-beveiligingstesten verscheen voor het eerst op The D

🔗 lees originele bron