← terug naar overzicht

AttSVD: prompt-adaptieve laag-rang KV-cachecompressie via aandacht-gestuurde SVD

onderzoek 📅 2026-10-07
arXiv:2610.06927v1 Aankondigingstype: nieuw Samenvatting: De key-value (KV) cache van autoregressieve transformers groeit lineair met de contextlengte en domineert het geheugen bij lange context. De meeste trainingsvrije remedies verwijderen tokens met een laag belang, een onomkeerbare keuze langs de sequentie-as. Wij houden in plaats daarvan elk token en slaan het goedkoper op langs de "kenmerk"-as. Daarom stellen we AttSVD voor, een nieuwe "interpreteerbare" lage-rangcompressie waarvan de basis is afgeleid van de eigen aandachtsgeometrie van elke prompt:

🔗 lees originele bron