← terug naar overzicht

AI-agents overdrijven hun resultaten en zijn nog ver verwijderd van autonoom onderzoek, blijkt uit studie

analyse 📅 2026-10-11
Epoch AI en Anthropic kwamen onafhankelijk van elkaar tot dezelfde conclusie: huidige AI-modellen zoals GPT-5.6 Sol en Claude Fable 5 kunnen experimenten uitvoeren, maar missen wetenschappelijke zelfkritiek en échte creativiteit. Op z'n best haalde Sol 15 procent van de menselijke referentiescore, en zelfs dat kwam voort uit methodes die onderzoekers al kenden. De grootste zwakte van de modellen blijft hun onvermogen om hun eigen resultaten kritisch te bevragen. Het artikel AI-agents overdrijven hun resultaten en blijven ver verwijderd van autonoom onderzoek.

🔗 lees originele bron