Een uniforme benadering voor het interpreteren van kennisdistillatie bij grote taalmodellen via interacties
Ondanks het succes van kennisdistillatie in grote taalmodellen blijft het onderliggende mechanisme onduidelijk — deze paper ontleedt de outputscore van een LLM in een som van interacties, waarbij elke interactie een niet-lineaire relatie tussen invoervariabelen vertegenwoordigt.
🔗 lees originele bron