Branching policy optimization: sandbox-native reinforcement learning voor taalagenten
Reinforcement learning is het dominante paradigma geworden voor het trainen van LLM-agenten die in uitvoerbare sandboxes opereren. State-of-the-art algoritmen als PPO, RLOO en GRPO erven hun rollout-topologie van RLHF: per prompt worden N onafhankelijke trajecten gesampled en een voordeel berekend door een groepsbaseline af te trekken — een ontwerp dat een bepalende eigenschap van agent-sandboxes negeert.
🔗 lees originele bron