← terug naar overzicht

LoKiFormer: plaatsbewuste aandacht met ontkoppeld kennisgeheugen voor efficiënte pretraining van grote taalmodellen

onderzoek 📅 2026-08-14
Grote taalmodellen (LLM's) boeken doorbraak na doorbraak in uiteenlopende toepassingen, maar hun architecturen blijven inefficiënt tijdens pretraining door twee beperkingen: (i) self-attention mist een expliciete inductieve voorkeur voor lokaliteit, wat leidt tot overbodig modelleren van lokale informatie binnen sequenties; (ii) mixture-of-experts (MoE) koppelt kennisopslag impliciet aan rekencircuits, waardoor flexibele toegang tot kennis wordt belemmerd.

🔗 lees originele bron