Long-context reasoning on OOLONG-REAL 650 samples (175K bucket)
0.249Average RewardRecursive Agent Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| Recursive Agent OptimizationSteps=61.5, Time (s)=175.42026.05 | 0.249 | |
| Single AgentSteps=7.1, Time (s)=12.62026.05 | 0.129 |