Tekst-naar-videogeneratie versnellen met gekalibreerde sparse attention
Recente diffusiemodellen maken videogeneratie van hoge kwaliteit mogelijk, maar kampen met trage verwerkingstijden. De grote transformer-gebaseerde backbones in deze modellen worden afgeremd door spatiotemporele aandacht. In dit artikel tonen we aan dat een aanzienlijk deel van de token-naar-token-verbindingen consistent verwaarloosbare scores oplevert over uiteenlopende invoer heen, en dat hun patronen zich vaak herhalen over queries. De aandachtberekening kan in deze gevallen dus worden overgeslagen met nauwelijks tot geen effect op het resultaat.
🔗 lees originele bron