Reward Modeling on PPE Pref
67.7AccuracyConsistRM (Qwen3-8B)
Evaluation Results
| Method | Links | |
|---|---|---|
| ConsistRM (Qwen3-8B)Base Model=Qwen3-8B, Training Method=CAAR + CACR, GT=False2026.04 | 67.7 | |
| DeepSeek-GRM-27BBase Model=DeepSeek-27B, GT=True2026.04 | 67.2 | |
| Qwen3-8B + RFTBase Model=Qwen3-8B, Training Method=RFT, GT=True2026.04 | 65.4 | |
| ConsistRM (Qwen3-4B)Base Model=Qwen3-4B, Training Method=CAAR + CACR, GT=False2026.04 | 65.1 | |
| Qwen3-8B + SFTBase Model=Qwen3-8B, Training Method=SFT, GT=True2026.04 | 65 | |
| Qwen3-8B + TTRLBase Model=Qwen3-8B, Training Method=TTRL, GT=False2026.04 | 65 | |
| Qwen3-8B + CAARBase Model=Qwen3-8B, Training Method=CAAR, GT=False2026.04 | 64.8 | |
| Qwen3-4B + RFTBase Model=Qwen3-4B, Training Method=RFT, GT=True2026.04 | 64.7 | |
| Qwen3-4B + CAARBase Model=Qwen3-4B, Training Method=CAAR, GT=False2026.04 | 64.1 | |
| Qwen3-8BBase Model=Qwen3-8B2026.04 | 63.8 | |
| Qwen3-4BBase Model=Qwen3-4B2026.04 | 63.3 | |
| Qwen3-4B + SFTBase Model=Qwen3-4B, Training Method=SFT, GT=True2026.04 | 63.1 | |
| Qwen3-4B + TTRLBase Model=Qwen3-4B, Training Method=TTRL, GT=False2026.04 | 61.8 | |
| J1-Llama-8BBase Model=Llama-8B, GT=True2026.04 | 59.8 | |
| EvalPlanner-Llama-8BBase Model=Llama-8B, GT=True2026.04 | 54.3 |