Reward Modeling on AgentRewardBench
83.8PrecisionRule-based
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Rule-basedCategory=Official2026.03 | 83.8 | 55.9 | |
| Qwen3-VL-32BCategory=OS-Themis2026.03 | 76.8 | 39.3 | |
| Qwen3-VL-235BCategory=OS-Themis2026.03 | 76.1 | 54.4 | |
| Qwen3-VL-32BCategory=LLM-as-a-Judge2026.03 | 72.9 | 73.9 | |
| SEAgentCategory=Critic Model2026.03 | 71.6 | — | |
| Qwen3-VL-8BCategory=OS-Themis2026.03 | 71.6 | 39 | |
| GPT-4oCategory=LLM-as-a-Judge2026.03 | 68.1 | 80.3 | |
| Qwen3-VL-235BCategory=LLM-as-a-Judge2026.03 | 67.5 | 81.7 | |
| Qwen3-VL-8BCategory=LLM-as-a-Judge2026.03 | 66.3 | 82 | |
| GPT-4o MiniCategory=LLM-as-a-Judge2026.03 | 64.5 | 78.3 | |
| Qwen2.5-VL-72BCategory=LLM-as-a-Judge2026.03 | 64.5 | 86.1 | |
| Claude-3.7-SonnetCategory=LLM-as-a-Judge2026.03 | 64.3 | 89.8 |