GPT-5.6 lost 30-jaar oud wiskundig raadsel op in 90 minuten — wat betekent dit voor jouw kenniswerk?
📊 Kerncijfers
🔗 Geannoteerde bronnen
primair The Decoder
the-decoder.com — GPT-5.6 Sol reportedly disproves a 30-year-old statistics conjecture🗓️ 15 juli 2026 · Bevat: Edgar Dobriban (Wharton) gebruikte GPT-5.6 Sol Pro, Benjamini-Hochberg procedure, 90 minuten tot oplossing, GPT-5.5 faalde na 20+ uur, FDR 0,104 vs 0,1, Will Fithian-quote, preprint + code beschikbaar. Volledig toegankelijk.
context Preprint (UPenn)
faculty.wharton.upenn.edu — BH preprint🗓️ 2026 · Edgar Dobriban · De originele preprint met het tegenvoorbeeld voor de BH-procedure.
📋 Claims & verificatie
| Claim in blogpost | Bron | Status |
|---|---|---|
| "GPT-5.6 Sol loste een statistisch vermoeden uit 1996 op in 90 minuten" | The Decoder | ✅ Geverifieerd |
| "Het model ontkrachtte een vermoeden over de Benjamini-Hochberg procedure" | The Decoder | ✅ Geverifieerd |
| "GPT-5.5 faalde na 20+ uur met meerdere agents" | The Decoder | ✅ Geverifieerd |
| "Edgar Dobriban, associate professor aan Wharton, voerde het experiment uit" | The Decoder | ✅ Geverifieerd |
| "Will Fithian (Berkeley) noemde het 'the most interesting open problem in my area of statistics'" | The Decoder | ✅ Geverifieerd |
| "Het model is sinds 9 juli beschikbaar" | The Decoder | ⚠️ Indirect |
| "GPT-5.6 Sol is de eerste AI die senior-niveau consistent haalt op complexe redeneertaken" | The Decoder | ℹ️ Opinie/analyse |
| "Installatiebedrijf met 40 monteurs — storingsdiagnoses via AI met 95% zekerheid" | The Decoder | ℹ️ Opinie/analyse |
📝 Methodologie-noot
De primaire bron (The Decoder) is volledig toegankelijk — een upgrade ten opzichte van de vorige verificatie (17 juli 2026) waarin de bron ontoegankelijk was. Dit heeft geleid tot 5 opgewaardeerde claims (van ⚠️ naar ✅).
De beschikbaarheidsdatum "9 juli" wordt niet in The Decoder genoemd — de bron vermeldt alleen de publicatiedatum 15 juli. Dit is een claim die de blogpost-auteur uit andere bronnen moet hebben (mogelijk OpenAI's aankondiging).
De claims over "senior-niveau consistent" en de Nederlandse installatiebedrijf-casus zijn eigen analyses en MKB-vertalingen van de auteur — geen verifieerbare feiten uit de bron.
🧩 Gerelateerde faalpatronen
#1 — Blind vertrouwen in AI-output
De blogpost extrapoleert van één wiskundig resultaat naar brede claims over AI die "senior-niveau consistent haalt". De bron beschrijft één specifiek experiment — geen algemene prestatie-evaluatie.
#27 — Fictieve MKB-casestudy
Het installatiebedrijf met 40 monteurs en 95% storingsdiagnose is een verzonnen Nederlandse casus. De bron bevat geen MKB-voorbeelden — dit is een vertaalslag van de auteur.
#23 — Paraphrase drift
De bron zegt dat GPT-5.6 Sol Pro het probleem oploste. De blogpost generaliseert naar "GPT-5.6 Sol" zonder de "Pro"-specificatie en voegt "zelfstandig redeneren, hypothesen testen" toe — details die niet in de bron staan.