← terug naar dossiers
📁 Dossier

Een AI-agent loste een game in 24 uur op voor 571 dollar: dit betekent het voor jouw werk

📅 2026-09-08 ⚠️ In review — herverificatie 8 september 2026: 5 van 8 claims ✅; 2 ⚠️ Indirect (niet in bronnen); 1 ℹ️ Opinie/analyse

📊 Kerncijfers

~24 uur
Tijd om Portal volledig uit te spelen (23u43m)
3.336
Losse handelingen (tool calls) van de agent
$571
Kosten aan tokens (Tom's Hardware: $571,18)
GPT-6 Astra
OpenAI's vlaggenschipmodel dat de taak uitvoerde

🔗 Geannoteerde bronnen

secundair OpenAI's GPT-6 Astra model autonomously completes Portal in 24 hours

tomshardware.com/.../openais-gpt-6-astra...

🗓️ 7 september 2026 · Mark Tyson (Tom's Hardware) · Bevat: de details van het experiment (3.336 tool calls, $571,18 aan tokens, $200 Codex Pro-abonnement), de technische opzet (MCP + SourcePauseTool), en de duiding dat dit een demonstratie is van multimodale AI-intelligentie, geen benchmark.

secundair GPT-6 Astra beat Portal start to finish without human help in under 24 hours

the-decoder.com/gpt-6-astra-beat-portal...

🗓️ 7 september 2026 · Matthias Bastian (The Decoder) · Bevat: de bevestiging dat de agent Portal volledig uitspeelde zonder menselijke hulp (23 uur en 43 minuten), de tokenkosten (minstens $570), de technische opzet (MCP + SourcePauseTool), en de verwijzing naar OpenAI's 2016-doel om meerdere games met één agent op te lossen.

📋 Claims & verificatie

Claim in blogpostBronStatus
GPT-6 Astra is het nieuwste model van OpenAITom's Hardware✅ Geverifieerd
De agent speelde Portal uit zonder enige menselijke hulpThe Decoder✅ Geverifieerd
Het kostte bijna 24 uurThe Decoder✅ Geverifieerd
3.336 losse handelingenTom's Hardware✅ Geverifieerd
571 dollar aan rekenkracht (tokens)Tom's Hardware✅ Geverifieerd
OpenAI meldde dat Astra's redeneringen moeilijker te volgen werden naarmate de agent langer zelfstandig werkteTom's Hardware⚠️ Indirect
De robotdichtheid in de Nederlandse industrie behoort tot de hoogste ter wereldTom's Hardware⚠️ Indirect
"Een bedrag dat een jaar geleden ondenkbaar laag was voor dit soort autonoom werk"ℹ️ Opinie/analyse

📐 Methodologie-noot

Beide bronnen zijn relevant en dekken de kerncijfers (24 uur, 3.336 handelingen, $571). Twee claims zijn ⚠️ Indirect: (1) de claim dat "OpenAI meldde dat Astra's redeneringen moeilijker te volgen werden" staat in geen van beide bronnen — de bronnen beschrijven de technische opzet en de prestatie, maar noemen geen afnemende traceerbaarheid van redeneringen; (2) de claim over de Nederlandse robotdichtheid is Nederlandse context die niet in de internationale bronnen voorkomt. De ℹ️-claim ("een jaar geleden ondenkbaar laag") is een eigen inschatting van de auteur. De blogpost voegt daarnaast Nederlandse MKB-voorbeelden toe (accountantskantoor met vijftien medewerkers) die niet in de bronnen staan, maar dit betreft illustraties.

🧩 Gerelateerde faalpatronen

Agent Autonomie Zonder Grenzen (10/10) — de kern van dit dossier: een agent die urenlang autonoom handelt zonder menselijke tussenkomst, precies het scenario waarin destructieve acties zonder rem kunnen plaatsvinden.

AI-Betrouwbaarheidsverval (8/10) — 3.336 opeenvolgende handelingen illustreren het compounding-effect: hoe langer de autonome keten, hoe groter de kans op stille fouten.

AI Aansprakelijkheidsvacuüm (10/10) — de blogpost benoemt expliciet dat hoe autonomer de AI, hoe belangrijker de controlemechanismen, omdat niemand verantwoordelijk is als een autonome agent een fout maakt.

Blind vertrouwen op AI (9/10) — de waarschuwing om niet blindelings taken aan een agent toe te vertrouwen zonder verificatie en grenzen.