BudgetBench: een budgetgetrapt protocol en pilotharnas voor het evalueren van geheugenstrategieën in lokale large language model-agenten
arXiv:2609.13149v1 Aankondigingstype: nieuw Abstract: Voor lokale large language model-agents is actieve context een schaarse hulpbron: geheugencapaciteit, prefill-latency, cachegroei en servicedoelstellingen bepalen allemaal hoeveel invoertokens elke aanroep zich kan veroorloven. We presenteren BudgetBench, een actief-budgetprotocol en referentieharness die het invoertokenbudget per aanroep behandelt als de onafhankelijke variabele bij het vergelijken van geheugenstrategieën. Met model, taak, sampler en decoding vastgezet, doorloopt het budget...
🔗 lees originele bron