Gegeneraliseerd multimodaal foundation-model
arXiv:2609.22107v1 — Aankondigingstype: nieuw. Samenvatting: Het maken van voorspellingen met multimodale data wordt in uiteenlopende scenario's veel gebruikt. Bestaande multimodale fusion-modellen kunnen, eenmaal uitgerold, alleen omgaan met vooraf gedefinieerde modaliteiten (bijvoorbeeld beeld, tekst en audio) en afzonderlijke taken, waardoor ze zich moeilijk snel kunnen aanpassen aan nieuwe downstream-toepassingen. Daarom rijst een vanzelfsprekende maar behoorlijk ambitieuze vraag: bestaat er een algemeen multimodaal fusion-model dat toepasbaar is op willekeurige modaliteitscombinaties?
🔗 lees originele bron