← terug naar overzicht

OpenAI ontdekt dat ongeveer 30 procent van een populaire AI-codeertest niet deugt

analyse 📅 2026-07-09
OpenAI heeft SWE-Bench Pro doorgelicht, een veelgebruikte test om de programmeervaardigheden van AI-modellen te meten, en ontdekte dat ongeveer 30 procent van de taken niet deugt. Het bedrijf trekt zijn eerdere goedkeuring van de benchmark in.

🔗 lees originele bron