VideoFlexTok: flexibele grof-naar-fijn-videotokenisatie
Visuele tokenizers zetten hoogdimensionale ruwe pixels om in een gecomprimeerde representatie voor verdere modellering. Naast compressie bepalen tokenizers welke informatie behouden blijft en hoe die is georganiseerd. Een de facto standaard voor videotokenisatie is het weergeven van een video als een ruimtelijk-temporeel 3D-raster van tokens, waarbij elk token de bijbehorende lokale informatie uit het oorspronkelijke signaal vastlegt. Dit vereist dat het downstreammodel dat de tokens verwerkt, bijvoorbeeld een text-to-videomodel, zelf leert voorspellen hoe deze tokens zich tot elkaar verhouden.
🔗 lees originele bron