Reward Modeling on JudgeBench (Positional Consistency)
56.3Positional Consistency ScoreReflectRM
Evaluation Results
| Method | Links | |
|---|---|---|
| ReflectRMBackbone=Qwen3-8B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 56.3 | |
| ReflectRMBackbone=Qwen3-4B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 54.9 | |
| Unified TrainingBackbone=Qwen3-8B, Training Method=Unified Training2026.04 | 53.9 | |
| RFTBackbone=Qwen3-4B, Training Method=RFT2026.04 | 53.1 | |
| Unified TrainingBackbone=Qwen3-4B, Training Method=Unified Training2026.04 | 53.1 | |
| Qwen3-8BBackbone=Qwen3-8B2026.04 | 52.7 | |
| Qwen3-4BBackbone=Qwen3-4B2026.04 | 49.3 | |
| RFTBackbone=Qwen3-8B, Training Method=RFT2026.04 | 48.9 |