← terug naar overzicht

LVSum: een benchmark voor tijdsbewuste samenvatting van lange video's

onderzoek 📅 2026-07-20
Het samenvatten van lange video's vormt een flinke uitdaging voor multimodale grote taalmodellen (MLLM's), vooral als het gaat om temporele betrouwbaarheid over langere tijdsduur en het produceren van samenvattingen die zowel semantisch als temporeel goed onderbouwd zijn. We introduceren LVSum, een door mensen geannoteerde benchmark voor het evalueren van langdurige videosamenvatting met fijnmazige temporele afstemming. LVSum omvat 72 uiteenlopende video's verspreid over 13 domeinen met een gemiddelde duur van 16 minuten, elk geannoteerd met maximaal

🔗 lees originele bron