← terug naar overzicht

De gewichtsruimte-meetkunde van offline redeneertraining

onderzoek 📅 2026-06-24
Offline reinforcement-learning-verliesfuncties (RFT, RIFT, DFT, Offline GRPO, DPO) worden breed ingezet om redeneervermogen van grote teacher-modellen over te distilleren naar kleinere student-modellen, en worden doorgaans alleen vergeleken op downstream-nauwkeurigheid. Deze paper onderzoekt of ze mechanistisch van elkaar verschillen of convergeren naar een vergelijkbare gewichtsupdate. Zes methoden (SFT, RFT, DFT, RIFT, Offline GRPO, DPO) worden getraind op identieke wiskunde-uitvoer van één basismodel (Qwen3-4B) met attention-only LoRA.

🔗 lees originele bron