Reward Modeling on PPE-Preference 1k
51.7Positional ConsistencyReflectRM
Evaluation Results
| Method | Links | |
|---|---|---|
| ReflectRMBackbone=Qwen3-4B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 51.7 | |
| Unified TrainingBackbone=Qwen3-4B, Training Method=Unified Training2026.04 | 48.1 | |
| RFTBackbone=Qwen3-4B, Training Method=RFT2026.04 | 46.6 | |
| RFTBackbone=Qwen3-8B, Training Method=RFT2026.04 | 44.6 | |
| ReflectRMBackbone=Qwen3-8B, Training Method=Unified Training, Inference Strategy=Two-Stage Inference2026.04 | 44.3 | |
| Unified TrainingBackbone=Qwen3-8B, Training Method=Unified Training2026.04 | 44.2 | |
| Qwen3-8BBackbone=Qwen3-8B2026.04 | 42.1 | |
| Qwen3-4BBackbone=Qwen3-4B2026.04 | 34.9 |