Een AI-agent loste een game in 24 uur op voor 571 dollar: dit betekent het voor jouw werk
📊 Kerncijfers
🔗 Geannoteerde bronnen
secundair OpenAI's GPT-6 Astra model autonomously completes Portal in 24 hours
tomshardware.com/.../openais-gpt-6-astra...🗓️ 7 september 2026 · Mark Tyson (Tom's Hardware) · Bevat: de details van het experiment (3.336 tool calls, $571,18 aan tokens, $200 Codex Pro-abonnement), de technische opzet (MCP + SourcePauseTool), en de duiding dat dit een demonstratie is van multimodale AI-intelligentie, geen benchmark.
secundair GPT-6 Astra beat Portal start to finish without human help in under 24 hours
the-decoder.com/gpt-6-astra-beat-portal...🗓️ 7 september 2026 · Matthias Bastian (The Decoder) · Bevat: de bevestiging dat de agent Portal volledig uitspeelde zonder menselijke hulp (23 uur en 43 minuten), de tokenkosten (minstens $570), de technische opzet (MCP + SourcePauseTool), en de verwijzing naar OpenAI's 2016-doel om meerdere games met één agent op te lossen.
📋 Claims & verificatie
| Claim in blogpost | Bron | Status |
|---|---|---|
| GPT-6 Astra is het nieuwste model van OpenAI | Tom's Hardware | ✅ Geverifieerd |
| De agent speelde Portal uit zonder enige menselijke hulp | The Decoder | ✅ Geverifieerd |
| Het kostte bijna 24 uur | The Decoder | ✅ Geverifieerd |
| 3.336 losse handelingen | Tom's Hardware | ✅ Geverifieerd |
| 571 dollar aan rekenkracht (tokens) | Tom's Hardware | ✅ Geverifieerd |
| OpenAI meldde dat Astra's redeneringen moeilijker te volgen werden naarmate de agent langer zelfstandig werkte | Tom's Hardware | ⚠️ Indirect |
| De robotdichtheid in de Nederlandse industrie behoort tot de hoogste ter wereld | Tom's Hardware | ⚠️ Indirect |
| "Een bedrag dat een jaar geleden ondenkbaar laag was voor dit soort autonoom werk" | — | ℹ️ Opinie/analyse |
📐 Methodologie-noot
Beide bronnen zijn relevant en dekken de kerncijfers (24 uur, 3.336 handelingen, $571). Twee claims zijn ⚠️ Indirect: (1) de claim dat "OpenAI meldde dat Astra's redeneringen moeilijker te volgen werden" staat in geen van beide bronnen — de bronnen beschrijven de technische opzet en de prestatie, maar noemen geen afnemende traceerbaarheid van redeneringen; (2) de claim over de Nederlandse robotdichtheid is Nederlandse context die niet in de internationale bronnen voorkomt. De ℹ️-claim ("een jaar geleden ondenkbaar laag") is een eigen inschatting van de auteur. De blogpost voegt daarnaast Nederlandse MKB-voorbeelden toe (accountantskantoor met vijftien medewerkers) die niet in de bronnen staan, maar dit betreft illustraties.
🧩 Gerelateerde faalpatronen
Agent Autonomie Zonder Grenzen (10/10) — de kern van dit dossier: een agent die urenlang autonoom handelt zonder menselijke tussenkomst, precies het scenario waarin destructieve acties zonder rem kunnen plaatsvinden.
AI-Betrouwbaarheidsverval (8/10) — 3.336 opeenvolgende handelingen illustreren het compounding-effect: hoe langer de autonome keten, hoe groter de kans op stille fouten.
AI Aansprakelijkheidsvacuüm (10/10) — de blogpost benoemt expliciet dat hoe autonomer de AI, hoe belangrijker de controlemechanismen, omdat niemand verantwoordelijk is als een autonome agent een fout maakt.
Blind vertrouwen op AI (9/10) — de waarschuwing om niet blindelings taken aan een agent toe te vertrouwen zonder verificatie en grenzen.