← terug naar dossiers
📁 Dossier

GPT-5.6 lost 30-jaar oud wiskundig raadsel op in 90 minuten — wat betekent dit voor jouw kenniswerk?

📅 2026-07-16 ⚠️ In review — herverificatie 18 juli 2026: 5 van 8 claims ✅; 1 ⚠️ Indirect; 2 ℹ️ Opinie/analyse

📊 Kerncijfers

90 min
Tijd tot oplossing door GPT-5.6 Sol
30 jr
Openstaand wiskundig vermoeden
20+ uur
GPT-5.5 faalde (meerdere agents)
0,104
Werkelijke FDR vs. doel 0,1

🔗 Geannoteerde bronnen

primair The Decoder

the-decoder.com — GPT-5.6 Sol reportedly disproves a 30-year-old statistics conjecture

🗓️ 15 juli 2026 · Bevat: Edgar Dobriban (Wharton) gebruikte GPT-5.6 Sol Pro, Benjamini-Hochberg procedure, 90 minuten tot oplossing, GPT-5.5 faalde na 20+ uur, FDR 0,104 vs 0,1, Will Fithian-quote, preprint + code beschikbaar. Volledig toegankelijk.

context Preprint (UPenn)

faculty.wharton.upenn.edu — BH preprint

🗓️ 2026 · Edgar Dobriban · De originele preprint met het tegenvoorbeeld voor de BH-procedure.

📋 Claims & verificatie

Claim in blogpostBronStatus
"GPT-5.6 Sol loste een statistisch vermoeden uit 1996 op in 90 minuten" The Decoder ✅ Geverifieerd
"Het model ontkrachtte een vermoeden over de Benjamini-Hochberg procedure" The Decoder ✅ Geverifieerd
"GPT-5.5 faalde na 20+ uur met meerdere agents" The Decoder ✅ Geverifieerd
"Edgar Dobriban, associate professor aan Wharton, voerde het experiment uit" The Decoder ✅ Geverifieerd
"Will Fithian (Berkeley) noemde het 'the most interesting open problem in my area of statistics'" The Decoder ✅ Geverifieerd
"Het model is sinds 9 juli beschikbaar" The Decoder ⚠️ Indirect
"GPT-5.6 Sol is de eerste AI die senior-niveau consistent haalt op complexe redeneertaken" The Decoder ℹ️ Opinie/analyse
"Installatiebedrijf met 40 monteurs — storingsdiagnoses via AI met 95% zekerheid" The Decoder ℹ️ Opinie/analyse

📝 Methodologie-noot

De primaire bron (The Decoder) is volledig toegankelijk — een upgrade ten opzichte van de vorige verificatie (17 juli 2026) waarin de bron ontoegankelijk was. Dit heeft geleid tot 5 opgewaardeerde claims (van ⚠️ naar ✅).

De beschikbaarheidsdatum "9 juli" wordt niet in The Decoder genoemd — de bron vermeldt alleen de publicatiedatum 15 juli. Dit is een claim die de blogpost-auteur uit andere bronnen moet hebben (mogelijk OpenAI's aankondiging).

De claims over "senior-niveau consistent" en de Nederlandse installatiebedrijf-casus zijn eigen analyses en MKB-vertalingen van de auteur — geen verifieerbare feiten uit de bron.

🧩 Gerelateerde faalpatronen

#1 — Blind vertrouwen in AI-output

De blogpost extrapoleert van één wiskundig resultaat naar brede claims over AI die "senior-niveau consistent haalt". De bron beschrijft één specifiek experiment — geen algemene prestatie-evaluatie.

#27 — Fictieve MKB-casestudy

Het installatiebedrijf met 40 monteurs en 95% storingsdiagnose is een verzonnen Nederlandse casus. De bron bevat geen MKB-voorbeelden — dit is een vertaalslag van de auteur.

#23 — Paraphrase drift

De bron zegt dat GPT-5.6 Sol Pro het probleem oploste. De blogpost generaliseert naar "GPT-5.6 Sol" zonder de "Pro"-specificatie en voegt "zelfstandig redeneren, hypothesen testen" toe — details die niet in de bron staan.