LoKiFormer: plaatsbewuste aandacht met ontkoppeld kennisgeheugen voor efficiënte pretraining van grote taalmodellen
Grote taalmodellen (LLM's) boeken doorbraak na doorbraak in uiteenlopende toepassingen, maar hun architecturen blijven inefficiënt tijdens pretraining door twee beperkingen: (i) self-attention mist een expliciete inductieve voorkeur voor lokaliteit, wat leidt tot overbodig modelleren van lokale informatie binnen sequenties; (ii) mixture-of-experts (MoE) koppelt kennisopslag impliciet aan rekencircuits, waardoor flexibele toegang tot kennis wordt belemmerd.
🔗 lees originele bron