Meta-evaluation on AgentEvalBench 1.0 (test)
85URFEvalAgent
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| EvalAgentBackbone=Haiku 4.5, Comparison Baseline=LLM-Singleturn (B1), Judge=Opus 4.52026.05 | 85 | 96.2 | 95 | — | — | 97.4 | |
| EvalAgentBackbone=Sonnet 4.5, Comparison Baseline=LLM-Singleturn (B1), Judge=Opus 4.52026.05 | 85 | 90 | 88.8 | — | — | 90 | |
| EvalAgentBackbone=Sonnet 4.5, Comparison Baseline=Agent-Sourcecode (B2), Judge=Opus 4.52026.05 | 83.8 | 93.8 | 96.2 | — | — | 94.9 | |
| EvalAgentBackbone=Haiku 4.5, Comparison Baseline=Agent-Sourcecode (B2), Judge=Opus 4.52026.05 | 80 | 98.8 | 97.5 | — | — | 100 | |
| EvalAgentBackbone=Sonnet 4.5, Comparison Baseline=Agent-Onestage (B3), Judge=Opus 4.52026.05 | 71.2 | 78.8 | 81.2 | — | — | 84.2 | |
| EvalAgentBackbone=Haiku 4.5, Comparison Baseline=Agent-Onestage (B3), Judge=Opus 4.52026.05 | 68.8 | 92.5 | 96.2 | — | — | 92.5 | |
| EvalAgentBackbone=Sonnet 4.5, Comparison Baseline=Agent-Twostage (B4), Judge=Opus 4.52026.05 | 63.8 | 87.5 | 92.5 | 83.8 | 61.3 | 90 | |
| EvalAgentBackbone=Haiku 4.5, Comparison Baseline=Agent-Twostage (B4), Judge=Opus 4.52026.05 | 60 | 83.8 | 92.5 | 75 | 68.8 | 87.5 |