Reward Modeling on WEBPRMBENCH Average
89.19Pairwise AccWebArbiter-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| WebArbiter-7BEvaluation Protocol=WebPRM, Model Source=WebPRMs, Model Scale=7B2026.01 | 89.19 | 74.6 | |
| GPT-4oEvaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 83.68 | 60.29 | |
| WebArbiter-3BEvaluation Protocol=WebPRM, Model Source=WebPRMs, Model Scale=3B2026.01 | 83.65 | 59.06 | |
| GPT-4o-miniEvaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 82.64 | 56.92 | |
| GPT-5Evaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 82.13 | 65.5 | |
| Gemini-2.5-FlashEvaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 81.83 | 59.67 | |
| Claude-3.7-SonnetEvaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 81.65 | 60.98 | |
| DeepSeek-R1Evaluation Protocol=LLM-as-judge, Model Source=Proprietary2026.01 | 81.57 | 59.41 | |
| Llama-3-70B-InstructEvaluation Protocol=LLM-as-judge, Model Source=Open-source2026.01 | 80.71 | 52.55 | |
| Qwen2.5-7B-InstructEvaluation Protocol=LLM-as-judge, Model Source=Open-source2026.01 | 77.61 | 42.78 | |
| Qwen2.5-3B-InstructEvaluation Protocol=LLM-as-judge, Model Source=Open-source2026.01 | 69.27 | 26.76 | |
| WebShepherd-3BEvaluation Protocol=WebPRM, Model Source=WebPRMs, Model Scale=3B2026.01 | 68.08 | 43.6 | |
| WebShepherd-8BEvaluation Protocol=WebPRM, Model Source=WebPRMs, Model Scale=8B2026.01 | 64.34 | 43.28 |