Reward Modeling on RoboRewardBench
0.665MAERoboReward (8B)
Evaluation Results
| Method | Links | |
|---|---|---|
| RoboReward (8B)Parameters=8B, Access=Open2026.01 | 0.665 | |
| GPT-5 mini (2025-08-07)Access=Limited2026.01 | 0.691 | |
| LLM-as-a-VerifierBase model=RoboReward 8B, Reward formulation=Continuous, K=82026.07 | 0.72 | |
| GPT-5 (2025-08-07)Access=Limited2026.01 | 0.811 | |
| RoboReward (4B)Parameters=4B, Access=Open2026.01 | 0.845 | |
| Gemini 3 Pro (Preview)Access=Limited2026.01 | 0.851 | |
| GPT-5.2 (2025-12-11)Access=Limited2026.01 | 0.887 | |
| Qwen3-VL Instruct (8B)Parameters=8B, Access=Open2026.01 | 0.892 | |
| GPT-5.1 (2025-11-13)Access=Limited2026.01 | 0.901 | |
| Gemini 2.5 ProAccess=Limited2026.01 | 0.902 | |
| Qwen3-VL Instruct (30B)Parameters=30B, Access=Open2026.01 | 0.903 | |
| Gemini Robotics-ER 1.5Access=Limited2026.01 | 0.906 | |
| Gemini 3 Flash (Preview)Access=Limited2026.01 | 0.917 | |
| Gemini 2.5 FlashAccess=Limited2026.01 | 0.943 | |
| Gemini 2.5 Flash-LiteAccess=Limited2026.01 | 0.99 | |
| Qwen2.5-VL Instruct (72B)Parameters=72B, Access=Open2026.01 | 0.991 | |
| Qwen3-VL Instruct (4B)Parameters=4B, Access=Open2026.01 | 1.032 | |
| RoboReward 8BReward formulation=Discrete2026.07 | 1.11 | |
| Qwen2.5-VL Instruct (32B)Parameters=32B, Access=Open2026.01 | 1.137 | |
| Qwen2.5-VL Instruct (7B)Parameters=7B, Access=Open2026.01 | 1.172 | |
| Llama 4 Maverick InstructAccess=Open2026.01 | 1.271 | |
| GPT-5 nano (2025-08-07)Access=Limited2026.01 | 1.295 | |
| Llama 4 Scout InstructAccess=Open2026.01 | 1.485 | |
| Qwen2.5-VL Instruct (3B)Parameters=3B, Access=Open2026.01 | 1.607 |