← terug naar dossiers
📁 Dossier

GPT-5.6 lost 30-jaar oud wiskundig raadsel op in 90 minuten — wat betekent dit voor jouw kenniswerk?

📅 2026-07-16 ⚠️ In review — herverificatie 9 september 2026: 6 van 8 claims ✅; 1 ⚠️ Indirect (beschikbaarheid 'sinds 9 juli' niet in bron); 1 ℹ️ Opinie/analyse (MKB-casus). The Decoder-bron volledig toegankelijk — geen upgrades beschikbaar.

📊 Kerncijfers

90 min
tijd om het vermoeden te ontkrachten
30 jaar
leeftijd van het open probleem
130.000+
citaties van de BH-procedure
20 uur
tijd die GPT-5.5 nodig had (en faalde)

🔗 Geannoteerde bronnen

primair The Decoder — GPT-5.6 Sol disproves 30-year-old statistics conjecture

the-decoder.com/gpt-5-6-sol-reportedly-disproves-a-30-year-old-statistics-conjecture

🗓️ 15 juli 2026 · Matthias Bastian · Bevat: Edgar Dobriban (UPenn Wharton) gebruikte GPT-5.6 Sol Pro om de Benjamini-Hochberg (BH) procedure-aanname te ontkrachten; BH uit 1995, 130.000+ citaties; GPT-5.5 faalde na ~20 uur, GPT-5.6 Sol Pro loste het op in ~90 minuten; FDR-gap 0.104 vs 0.1; reacties van Will Fithian (Berkeley) en Richard Sutton.

📋 Claims & verificatie

Claim in blogpostBronStatus
GPT-5.6 Sol ontkrachtte een statistisch vermoedenThe Decoder✅ Geverifieerd
Het vermoeden is ~30 jaar oudThe Decoder✅ Geverifieerd
Opgelost in 90 minutenThe Decoder✅ Geverifieerd
Generaties wiskundigen beten hun tanden stukThe Decoder✅ Geverifieerd
Zelfstandig redeneren en een tegenvoorbeeld construerenThe Decoder✅ Geverifieerd
Model is sinds 9 juli beschikbaarThe Decoder⚠️ Indirect
Eerste AI die senior-niveau consistent haalt op complexe redeneertakenℹ️ Opinie/analyse
MKB-casus: installatiebedrijf met 40 monteurs, diagnose met 95% zekerheidℹ️ Opinie/analyse

📝 Methodologie-noot

De bron (The Decoder) is volledig toegankelijk en bevestigt de kernclaims letterlijk: GPT-5.6 Sol Pro ontkrachtte de BH-procedure-aanname in ~90 minuten, na ~20 uur falen van GPT-5.5. De claim "sinds 9 juli beschikbaar" staat niet in deze bron (de lanceerdatum van GPT-5.6 Sol wordt niet genoemd) — ⚠️ Indirect. De MKB-casus (installatiebedrijf, 95% zekerheid) is een fictief Nederlands voorbeeld van de blogpost-pipeline, niet uit de bron — ℹ️ Opinie/analyse. De claim "eerste AI die senior-niveau consistent haalt" is een eigen kwalificatie van de auteur.

🧩 Gerelateerde faalpatronen

Verzonnen kwantitatieve claims — de blogpost voegt een fictieve MKB-casus met exacte cijfers (95% zekerheid, 40 monteurs) toe die niet in de bron staat.

Nederlandse context-claims zonder brondekking — de vertaalslag naar het Nederlandse MKB (installatiebedrijf in Brabant) is niet verifieerbaar tegen de internationale bron.

Paraphrase drift — "senior-niveau consistent haalt" is een aanscherping van de bron, die spreekt over een meetbare capability-sprong (GPT-5.5 → GPT-5.6).