Voorspelbare GRPO: een model in gesloten vorm van trainingsdynamiek
arXiv:2606.30789v1 – Aankondigingstype: nieuw – Samenvatting: Group Relative Policy Optimization (GRPO) is een standaardinstrument geworden voor het verbeteren van het redeneervermogen van grote taalmodellen, maar de trainingsdynamiek wordt nog steeds empirisch beschreven: beloningstrajecten worden gefit met laag-parametrische functievormen waarvan de constanten geen mechanistische betekenis dragen, en hyperparameterkeuzes blijven een kwestie van trial-and-error. We ontwikkelen een gereduceerd-orde-model van deze dynamiek vanuit eerste principes. De reductie heeft aanzienlijke implicaties.
🔗 lees originele bron