Op weg naar gebruikersgestuurde evaluatie van persoonlijke LLM-agents onder temporele interventies
arXiv:2607.21635v1 — Persoonlijke agenten onderhouden herinneringen, aangeleerde vaardigheden, toolconfiguraties en beleidsstatus die met elke gebruiker mee-evolueren. Bestaande agentbenchmarks evalueren deze capaciteiten vaak geïsoleerd: toolbenchmarks testen aanroep onder vaste API's, geheugenbenchmarks testen herinnering of vergeten, en veiligheidsbenchmarks testen statische beleidsnaleving. Wij stellen dat evaluatie van persoonlijke agenten een ander protocol vereist: het herhaald afspelen van dezelfde temporele interventie […]
🔗 lees originele bron