Reward Modeling on RewardBench 1k
84.9Positional ConsistencyReflectRM
Evaluation Results
| Method | Links | |
|---|---|---|
| ReflectRMBackbone=Qwen3-8B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 84.9 | |
| Unified TrainingBackbone=Qwen3-8B, Training Method=Unified Training2026.04 | 83.6 | |
| ReflectRMBackbone=Qwen3-4B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 81.1 | |
| RFTBackbone=Qwen3-8B, Training Method=RFT2026.04 | 78.8 | |
| Unified TrainingBackbone=Qwen3-4B, Training Method=Unified Training2026.04 | 78.5 | |
| Qwen3-8BBackbone=Qwen3-8B2026.04 | 78.4 | |
| RFTBackbone=Qwen3-4B, Training Method=RFT2026.04 | 75.1 | |
| Qwen3-4BBackbone=Qwen3-4B2026.04 | 74.8 | |
| ReflectRMBackbone=Qwen3-4B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 68.3 | |
| RFTBackbone=Qwen3-8B, Training Method=RFT2026.04 | 67 | |
| Unified TrainingBackbone=Qwen3-4B, Training Method=Unified Training2026.04 | 64.3 | |
| Qwen3-8BBackbone=Qwen3-8B2026.04 | 60.9 | |
| ReflectRMBackbone=Qwen3-8B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 59.4 | |
| Unified TrainingBackbone=Qwen3-8B, Training Method=Unified Training2026.04 | 58.4 | |
| RFTBackbone=Qwen3-4B, Training Method=RFT2026.04 | 56.5 | |
| Qwen3-4BBackbone=Qwen3-4B2026.04 | 52.3 |