Reward Prediction on RewardPrediction
82.3AlfWorld Reward ScoreVLWM-critic
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| VLWM-criticBackbone=Llama3.2-1B, Training Data=VLWM Trajectories, Reasoning=N/A, Zero-shot=✓2026.03 | 82.3 | 67.3 | 63.6 | 66.3 | 89.6 | 73.8 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=WebShop, Reasoning=N/A, Zero-shot=✗2026.03 | 70.7 | 62.4 | 24.2 | 70.6 | 70.7 | 59.7 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=BlocksWorld, Reasoning=N/A, Zero-shot=✗2026.03 | 55.6 | 47.1 | 59.6 | 47.2 | 55.6 | 53 | |
| Monotonic BaselineBackbone=-, Training Data=-, Reasoning=-, Zero-shot=✓2026.03 | 53.2 | 50.8 | 53.5 | 58.9 | 53.6 | 54 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=TextWorld, Reasoning=N/A, Zero-shot=✗2026.03 | 52.3 | 65.8 | 67.8 | 60.4 | 20.3 | 53.3 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=ScienceWorld, Reasoning=N/A, Zero-shot=✗2026.03 | 50.6 | 30.5 | 66.1 | 70.6 | 58 | 55.2 | |
| LLM-as-a-JudgeBackbone=Qwen3-14B, Training Data=-, Reasoning=✗, Zero-shot=✓2026.03 | 39.5 | 54.2 | 40.3 | 46.6 | 31.6 | 42.4 | |
| LLM-as-a-JudgeBackbone=Qwen3-14B, Training Data=-, Reasoning=✓, Zero-shot=✓2026.03 | 37 | 37.1 | 35.6 | 43.6 | 21.1 | 34.9 | |
| LLM-as-a-JudgeBackbone=gpt-oss-20b, Training Data=-, Reasoning=Low, Zero-shot=✓2026.03 | 36.8 | 39.4 | 37.6 | 36.2 | 11.9 | 32.4 | |
| LLM-as-a-JudgeBackbone=gpt-oss-20b, Training Data=-, Reasoning=Medium, Zero-shot=✓2026.03 | 36.6 | 39.1 | 37.4 | 36.3 | 11.5 | 32.2 | |
| StateFactoryBackbone=gpt-oss-20b, Training Data=-, Reasoning=Medium, Zero-shot=✓2026.03 | 28.5 | 28.8 | 28.6 | 42.7 | 20.1 | 29.7 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=AlfWorld, Reasoning=N/A, Zero-shot=✗2026.03 | 21.2 | 54.2 | 61.8 | 59.6 | 41.4 | 47.6 | |
| Supervised RMBackbone=Qwen2.5-1.5B, Training Data=All Domains, Reasoning=N/A, Zero-shot=✗2026.03 | 17.8 | 28.3 | 28.5 | 48.9 | 17.7 | 28.2 |