De probabilistische structuur van grote taalmodellen
arXiv:2609.25134v1 Aankondigingstype: nieuw Samenvatting: Dit artikel presenteert een probabilistisch perspectief op grote taalmodellen (LLM's), ontwikkeld met als doel om, in één op zichzelf staand overzicht, instrumenten samen te brengen die in de literatuur doorgaans apart worden behandeld. LLM's worden beschreven via kansmaten op de verzameling reeksen van tokens, gespecificeerd via hun autoregressieve conditionele verdelingen. Training wordt geformuleerd als een maximum-likelihoodschattingsprobleem, aangepakt door
🔗 lees originele bron