Hugging Face-modellen op Foundry Managed Compute
Deze studie richt zich op Text-to-Sounding-Video (T2SV) generatie, waarbij video met gesynchroniseerde audio uit tekst wordt gegenereerd en beide modaliteiten op de tekstvoorwaarden zijn afgestemd. Ondanks vooruitgang in gezamenlijke audio-videotraining blijven er twee kritieke uitdagingen: (1) tekstconditionering vormt een knelpunt — gedeelde bijschriften (TV=TA) veroorzaken modale interferentie, terwijl er een kloof blijft tussen uitgebreide trainingsbijschriften en beknopte gebruikersprompts tijdens inferentie, en (2) het optimale fusiemechanisme voor cross-modale kenmerken
🔗 lees originele bron