← terug naar overzicht

Prism Transformer: Progressieve hoofdschema's voor hiërarchische aandachtsverwerking

onderzoek 📅 2026-06-29
arXiv:2606.27449v1 — Multi-head attention verdeelt de verborgen dimensie conventioneel gelijkmatig over alle hoofden in elke laag, waardoor een identieke representatiedeelruimtedimensie (dh = dmodel/h) over de volledige diepte van het model wordt afgedwongen. In dit werk identificeren we deze uniforme toewijzing als een fundamenteel structureel knelpunt: door hun beperkte dimensionele ruimte zijn hoofden in vroege lagen niet in staat om complexe, hoogdimensionale contextuele patronen getrouw vast te leggen.

🔗 lees originele bron