Reward Modeling on RM-Bench 1k
73.5Positional ConsistencyReflectRM
Evaluation Results
| Method | Links | |
|---|---|---|
| ReflectRMBackbone=Qwen3-8B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 73.5 | |
| Unified TrainingBackbone=Qwen3-8B, Training Method=Unified Training2026.04 | 72.6 | |
| RFTBackbone=Qwen3-4B, Training Method=RFT2026.04 | 67.1 | |
| ReflectRMBackbone=Qwen3-4B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 66.6 | |
| RFTBackbone=Qwen3-8B, Training Method=RFT2026.04 | 65.6 | |
| Qwen3-8BBackbone=Qwen3-8B2026.04 | 64.9 | |
| Unified TrainingBackbone=Qwen3-4B, Training Method=Unified Training2026.04 | 64.3 | |
| Qwen3-4BBackbone=Qwen3-4B2026.04 | 60.5 |