← terug naar overzicht

Sticky Routing: MoE-modellen trainen voor geheugenefficiënte inferentie

onderzoek 📅 2026-07-13
MoE-modellen activeren per token slechts een deel van de experts, maar opeenvolgende tokens schakelen vaak tussen verschillende experts, wat constant gewissel tussen trage opslag en snel geheugen veroorzaakt op edge-apparaten — StickyMoE pakt dit aan met een differentieerbare routeringsconsistentie-verliesfunctie tijdens pretraining.

🔗 lees originele bron