← terug naar overzicht

AhaBench: Leren agenten van eerdere ervaring? Een benchmark voor continu leren over lange tijdshorizonten

onderzoek 📅 2026-09-10
7. arXiv:2609.05435v1 Aankondigingstype: nieuw. Samenvatting: Van moderne taalagenten wordt verwacht dat ze over lange tijdshorizonten opereren: ze stellen vervolgvragen, hergebruiken uitgewerkte voorbeelden, verwerken tool-feedback en passen zich aan aan vertraagde gevolgen. De meeste evaluaties resetten de agent nog steeds na een prompt of scoren alleen de eindtoestand van één traject. AhaBench stelt een meer operationele vraag: wanneer een vast model nuttige ervaring opdoet, verbetert zijn latere gedrag dan onder een gerelateerde evaluatieconditie waar de voor de hand liggende...

🔗 lees originele bron