Long-context reasoning on OOLONG-REAL 650 samples (55K bucket)
45.4Average RewardRecursive Agent Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| Recursive Agent OptimizationSteps=61.5, Time (s)=175.42026.05 | 45.4 | |
| Single AgentSteps=7.1, Time (s)=12.62026.05 | 35.1 |