GRAFT: geënte referentie-audio voor fijnmazige uitspraak in zero-shot tekst-naar-spraak
We presenteren GRAFT, een per-woord uitspraakconditioneringsmechanisme voor neurale codec-taalmodellering in tekst-naar-spraak. Bestaande systemen bereiken hoge verstaanbaarheid en natuurlijkheid, maar erven de dubbelzinnigheid van tekst en spreken zeldzame eigennamen, leenwoorden en technische termen verkeerd uit. Zelfs foneemgeconditioneerde modellen bieden geen directe akoestische handgreep voor uitspraak per woord. GRAFT stuurt de uitspraak van een gekozen woord op basis van een kort gesproken voorbeeld ervan
🔗 lees originele bron