Brits AI-veiligheidsinstituut stelt vast dat standaard benchmarks systematisch onderschatten wat AI-agents werkelijk kunnen
In een studie over zeven benchmarks toont het Britse AI Security Institute aan dat standaard AI-evaluaties de capaciteiten van agents systematisch onderschatten door het rekenbudget te beperken. Bij software-engineeringtaken stegen de succespercentages met ongeveer 25 procent toen het tokenbudget vertienvoudigd werd. Nieuwere modellen profiteren het meest. Afhankelijk van het tokenbudget is de werkelijke vooruitgang aan de frontier ongeveer 60 procent steiler dan eerdere metingen suggereerden, aldus AISI.
🔗 lees originele bron