← terug naar overzicht

Blokparallellisme voor efficiënte gedistribueerde training van lange-context-diffusie-taalmodel

onderzoek 📅 2026-09-18
Block diffusion-taalmodellen (BDLM's) combineren autoregressieve afhankelijkheden tussen blokken met parallelle denoising binnen blokken, maar het trainen met lange context wordt beperkt door gedistribueerde aandachtscommunicatie en activeringsgeheugen. Conventioneel context-parallellisme (CP) versnippert de gecombineerde schone-plus-gecorrumpeerde reeks op positie, waarbij gedeelde schone K/V samen met blokspecifieke gecorrumpeerde K/V en hun gradiënten worden gecommuniceerd. We constateren dat de BDLM…

🔗 lees originele bron