← terug naar overzicht

ExFold: unified expert folding voor trainingsvrije MoE prefill-decode-versnelling

onderzoek 📅 2026-08-27
arXiv:2608.24938v1 Aankondigingstype: nieuw Samenvatting: Mixture-of-Experts (MoE)-modellen schalen capaciteit voor sterke kwaliteit terwijl de per-token rekenlast begrensd blijft door schaarse expert-activatie. Toch wordt het serveren van MoE met lage latentie steeds uitdagender, omdat het twee inferentiefasen omspant met fundamenteel verschillende knelpunten: prefill wordt gedomineerd door token-gewijze expert-berekening, terwijl decode wordt beperkt door geheugenverkeer van de batch-gewijs geactiveerde expert-set. Bestaande trainingsvrije

🔗 lees originele bron