Claude Tag π¬, Seedance 2.5 π₯, Mistral OCR 4 π§
Onderzoekers vergeleken zes offline reinforcement-learning-methoden (SFT, RFT, DFT, RIFT, Offline GRPO, DPO) op identieke wiskunde-uitvoer van Qwen3-4B met attention-only LoRA om te bepalen of ze mechanistisch van elkaar verschillen of juist naar dezelfde gewichtsupdate convergeren.
π lees originele bron