Concept icon
Concept

Evolutionary Group Decoupled Policy Optimization (Evo-GDPO)

Evolutionary Group-Decoupled Policy Optimization (Evo-GDPO) is an online reinforcement learning algorithm designed to train a harness generator model to continually surpass prior scaffold designs during test-time execution. At each round, the policy samples a candidate group of agent harnesses hi∼pθold(⋅∣cτ,n)\mathbf{h}_i \sim p_{\theta_{\text{old}}}(\cdot \mid \mathbf{c}_{\tau,n}) for i=1,…,Gi = 1, \dots, G. These candidates are evaluated alongside an incumbent harness retrieved from an evolving archive Bn\mathcal{B}_n under identical seeds and execution budgets. Rather than simply rewarding within-group performance, Evo-GDPO optimizes the generator to overtake the incumbent's performance frontier across decoupled reward, latency, and monetary cost signals.

0

1

Concept icon
Updated 2026-10-02

Tags

Prep Sessions

Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Ch.3 Adaptive Agent Harness Design - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Stage III Test-Time Adaptation with Evo-GDPO - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor

Ch.2 Multi-Stage Harness Optimization - Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor

Stage III: Evolutionary Group-Decoupled Policy Optimization - Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor