← terug naar dossiers
📁 Dossier

Niet het AI-model, maar het harnas eromheen bepaalt straks je succes

📅 2026-08-22 ⚠️ In review — herverificatie 22 augustus 2026: 2 van 6 claims ✅; 3 ⚠️ Indirect (68% lanceringstijd is afgeleid van Codex's 3.16x, niet ChatGPT Work; 'commodity'-framing is blogpost-interpretatie; NL-context Exact/AFAS niet in bronnen); 0 ❌; 1 ℹ️ Opinie/analyse.

📊 Kerncijfers

100%
ARC-AGI-3-score met harnas (Claude Opus 5)
30%
zonder harnas — nog steeds de beste score
3,16x
snellere lancering bij Stampli (Codex)
2x
kostenverschil door verkeerd harnas (Databricks)

🔗 Geannoteerde bronnen

primair TechCrunch — Nvidia: the harness, not the AI model, is now the real hero

techcrunch.com/…/nvidia-just-showed-that-the-harness-not-the-ai-model…

🗓️ 21 aug 2026 · Julie Bort · NVIDIA-onderzoek toont dat een custom harnas (met geheugen + 'supervisor'-component) Claude Opus 5 van 30% naar 100% op ARC-AGI-3 bracht. VP Adel El Hallack: 'an agent is the model, the scaffolding (harness), the runtime and the skills.'

primair OpenAI — How ChatGPT Work helps Stampli move ideas to market

openai.com/index/stampli

🗓️ 20 aug 2026 · OpenAI customer story · Stampli lanceerde Deep Finance in ~6 weken. Codex gaf 3.16x snellere productie (243→77 uur). ChatGPT Work produceert honderden contentstukken per week. Let op: de 3.16x is aan Codex toegeschreven, niet aan ChatGPT Work.

primair Hugging Face / IBM Research — How Much Memory Does Your Agent Actually Need?

huggingface.co/blog/ibm-research/altk-evolve-hmm

🗓️ 18 aug 2026 · IBM Research · ALTK-Evolve laat een agent leren van eigen trajecten. De juiste 'geheugendosis' verschilt per modeltier: sterke modellen willen de volledige richtlijnenset, zwakkere modellen een compacte kern + retrieval.

📋 Claims & verificatie

Claim in blogpostBronStatus
"NVIDIA zegt: het harnas, niet het model, is de echte held geworden" TechCrunch ✅ Geverifieerd
"Stampli verkortte zijn lanceringstijd met 68 procent met ChatGPT Work" OpenAI ⚠️ Indirect
"De vraag hoeveel werkgeheugen een AI-agent nodig heeft, bepaalt of een toepassing soepel draait of vastloopt" Hugging Face / IBM ✅ Geverifieerd
"De ruwe intelligentie van een AI-model wordt steeds meer een commodity" TechCrunch ⚠️ Indirect
"Exact, AFAS en vergelijkbare partijen integreren AI-functionaliteit in boekhoud-, plannings- en klantsystemen" ⚠️ Indirect
"Een AI-project faalt zelden omdat het model te dom is; het faalt omdat de koppeling met het echte werk ontbreekt" ℹ️ Opinie/analyse

📝 Methodologie-noot

Alle drie de bronnen zijn volledig toegankelijk. De kernboodschap (harnas > model) is letterlijk de TechCrunch-titel. Twee nuances: (1) de '68% lanceringstijd'-claim is wiskundig correct afgeleid van Codex's 3.16x (1 − 1/3.16 ≈ 68%), maar de blogpost schrijft de versnelling toe aan ChatGPT Work terwijl de OpenAI-bron de 3.16x expliciet aan Codex toeschrijft — een tool-attributiefout. (2) 'commodity' is de blogpost-interpretatie van NVIDIA's boodschap; de bron gebruikt die term niet letterlijk. De Nederlandse context (Exact, AFAS) is lokale duiding zonder brondekking.

🧩 Gerelateerde faalpatronen

Tool/platform attribution error — de 68% wordt aan ChatGPT Work toegeschreven terwijl de bron Codex noemt.

Nederlandse context-claims zonder brondekking — Exact/AFAS-integratie staat niet in de internationale bronnen.

Paraphrase drift — 'commodity' is een interpretatie van NVIDIA's 'harness is the real hero'-framing.