Wanneer helpt externe begeleiding bij het redeneren van LLM's? Een bias-variantietheorie van begeleidings-versterkte GRPO
arXiv:2610.06861v1 Aankondigingstype: nieuw Samenvatting: Reinforcement learning met verifieerbare beloningen (RLVR) is het dominante paradigma geworden voor het uitlokken van meerstaps-redeneren in grote taalmodellen, en een recente golf van methoden (LUFFY, ExPO, PAPO, TAPO) versterkt RL verder met externe sturing — deskundige sporen, zelf-uitleg of opgehaalde denkpatronen. Hoewel elke methode empirische winst rapporteert, geeft geen ervan convergentiesnelheden, vertekeningsgrenzen of een optimale wegingsregel voor de stu
🔗 lees originele bron