Reward Prediction on RoboRewardBench 1.0
0.665Overall MAERoboReward 8B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RoboReward 8BParameters=8B, Supervision=High-quality, diverse reward supervision2026.01 | 0.665 | 0.768 | 0.66 | |
| GPT-5 miniVersion=2025-08-072026.01 | 0.691 | 0.862 | 0.683 | |
| GPT-5Version=2025-08-072026.01 | 0.811 | 1.028 | 0.801 | |
| RoboReward 4BParameters=4B, Supervision=High-quality, diverse reward supervision2026.01 | 0.845 | 0.806 | 0.847 | |
| Gemini 3 ProVersion=Preview2026.01 | 0.851 | 1.234 | 0.833 | |
| Qwen3-VL InstructParameters=8B, Type=Instruct2026.01 | 0.892 | 0.847 | 0.894 | |
| Gemini 2.5 Pro2026.01 | 0.902 | 0.936 | 0.9 | |
| Gemini Robotics-ER 1.5Version=1.52026.01 | 0.906 | 1.002 | 0.902 | |
| Gemini 2.5 Flash2026.01 | 0.943 | 1.19 | 0.931 | |
| Qwen3-VL InstructParameters=4B, Type=Instruct2026.01 | 1.032 | 0.929 | 1.036 | |
| Llama 4 Scout InstructType=Instruct2026.01 | 1.485 | 1.83 | 1.469 | |
| Qwen2.5-VL InstructParameters=3B, Type=Instruct2026.01 | 1.607 | 1.443 | 1.614 |