De gewichtsruimte-meetkunde van offline redeneertraining
Offline reinforcement-learning-verliesfuncties (RFT, RIFT, DFT, Offline GRPO, DPO) worden breed ingezet om redeneervermogen van grote teacher-modellen over te distilleren naar kleinere student-modellen, en worden doorgaans alleen vergeleken op downstream-nauwkeurigheid. Deze paper onderzoekt of ze mechanistisch van elkaar verschillen of convergeren naar een vergelijkbare gewichtsupdate. Zes methoden (SFT, RFT, DFT, RIFT, Offline GRPO, DPO) worden getraind op identieke wiskunde-uitvoer van één basismodel (Qwen3-4B) met attention-only LoRA.
🔗 lees originele bron