Learn Before
Stage III Test-Time Adaptation with Evo-GDPO - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor
Stage III: Evolutionary Group-Decoupled Policy Optimization - Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor
Evolutionary Group Decoupled Policy Optimization (Evo-GDPO)
Evolutionary Group-Decoupled Policy Optimization (Evo-GDPO) is an online reinforcement learning algorithm designed to train a harness generator model to continually surpass prior scaffold designs during test-time execution. At each round, the policy samples a candidate group of agent harnesses for . These candidates are evaluated alongside an incumbent harness retrieved from an evolving archive under identical seeds and execution budgets. Rather than simply rewarding within-group performance, Evo-GDPO optimizes the generator to overtake the incumbent's performance frontier across decoupled reward, latency, and monetary cost signals.
0
1
Tags
Prep Sessions
Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor
Ch.3 Adaptive Agent Harness Design - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor
Stage III Test-Time Adaptation with Evo-GDPO - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor
Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor
Ch.2 Multi-Stage Harness Optimization - Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor
Stage III: Evolutionary Group-Decoupled Policy Optimization - Dynamic Agent Scaffolding: Synthesis, Diagnostic Repair, and Evolutionary Optimization @ University of Michigan - Ann Arbor
Related
Evolutionary Group Decoupled Policy Optimization (Evo-GDPO)
Archive Admission Criterion for Candidate Harnesses
Decoupled Reward and Efficiency Formulations in Evo-GDPO
Decoupled Advantage Normalization in Evo-GDPO
Evo-GDPO Clipped Surrogate Policy Objective
Proximal Policy Optimization (PPO)
Evolutionary Group Decoupled Policy Optimization (Evo-GDPO)
Archive Admission Criterion for Candidate Harnesses
Learn After
Which type of systems is the Evolutionary Group Decoupled Policy Optimization (Evo-GDPO) framework designed to adapt?
At what operational phase is Evolutionary Group Decoupled Policy Optimization (Evo-GDPO) designed to perform adaptation?
Archive Admission Criterion for Candidate Harnesses
In Evo-GDPO, newly sampled harness candidates and the retrieved incumbent harness are evaluated under identical seeds and execution budgets.
Explain the optimization objective of Evolutionary Group-Decoupled Policy Optimization (Evo-GDPO) and explain how its evaluation baseline and performance signals contrast with traditional within-group ranking.
Match each Evo-GDPO component to its specific operational role in the algorithm.
Order the operational stages carried out during an optimization round in Evolutionary Group-Decoupled Policy Optimization (Evo-GDPO).
Decoupled Reward and Efficiency Formulations in Evo-GDPO