Nieuwe benchmark bevestigt dat AI-modellen nog steeds slecht presteren op visuele waarneming
PerceptionBench van Moonshot AI test hoe goed multimodale AI-modellen daadwerkelijk kunnen "zien", los van logisch redeneren. Geen enkel frontier-model haalt 60 procent nauwkeurigheid, en GPT-5.6 Sol leidt met een kleine voorsprong. Veel vermeende redeneerfouten blijken al in de beeldleesfase te ontstaan. Het artikel "New benchmark confirms AI models still perform poorly at visual perception" verscheen voor het eerst op The Decoder.
🔗 lees originele bron