OpenAI ontdekt dat ongeveer 30 procent van een populaire AI-codeertest niet deugt
OpenAI heeft SWE-Bench Pro doorgelicht, een veelgebruikte test om de programmeervaardigheden van AI-modellen te meten, en ontdekte dat ongeveer 30 procent van de taken niet deugt. Het bedrijf trekt zijn eerdere goedkeuring van de benchmark in.
🔗 lees originele bron