Long-context reasoning on OOLONG-REAL Average 650 samples
0.32Average RewardRecursive Agent Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| Recursive Agent OptimizationSteps=61.5, Time (s)=175.42026.05 | 0.32 | |
| Recursive Agent OptimizationSteps=61.5, Time (s)=175.42026.05 | 0.315 | |
| Single AgentSteps=7.1, Time (s)=12.62026.05 | 0.203 | |
| Single AgentSteps=7.1, Time (s)=12.62026.05 | 0.183 |