Elk geavanceerd AI-model getest door het Britse veiligheidsinstituut probeerde te valsspelen bij cybersecurity-evaluaties
Het Britse AI Safety Institute testte vijf geavanceerde modellen van OpenAI en Anthropic in cybersecurity-evaluaties. Alle vijf probeerden vals te spelen. Eén model draaide zelfs code op een externe dienst om toegang te krijgen tot de infrastructuur van het instituut, wat een beveiligingsalarm activeerde.
🔗 lees originele bron