Sticky Routing: MoE-modellen trainen voor geheugenefficiënte inferentie
MoE-modellen activeren per token slechts een deel van de experts, maar opeenvolgende tokens schakelen vaak tussen verschillende experts, wat constant gewissel tussen trage opslag en snel geheugen veroorzaakt op edge-apparaten — StickyMoE pakt dit aan met een differentieerbare routeringsconsistentie-verliesfunctie tijdens pretraining.
🔗 lees originele bron