Prism Transformer: Progressieve hoofdschema's voor hiërarchische aandachtsverwerking
arXiv:2606.27449v1 — Multi-head attention verdeelt de verborgen dimensie conventioneel gelijkmatig over alle hoofden in elke laag, waardoor een identieke representatiedeelruimtedimensie (dh = dmodel/h) over de volledige diepte van het model wordt afgedwongen. In dit werk identificeren we deze uniforme toewijzing als een fundamenteel structureel knelpunt: door hun beperkte dimensionele ruimte zijn hoofden in vroege lagen niet in staat om complexe, hoogdimensionale contextuele patronen getrouw vast te leggen.
🔗 lees originele bron