Gerichte recovery van weight-space-mechanismen uit neurale netwerken
Parameterdecompositie (PD) ontleedt neurale netwerken in interpreteerbare computationele componenten die getrouw de werking van het oorspronkelijke netwerk weerspiegelen. Het opschalen van PD naar grote modellen vergt echter enorme rekenkracht, wat het een kostbare en risicovolle onderneming maakt. Hier stellen we targeted PD (tPD) voor, die uitsluitend de componenten identificeert die specifieke invoer van belang verwerken — van geïsoleerde prompts tot grote deeltaken — door een hoog-dimensionale catch-all-component te introduceren.
🔗 lees originele bron