Reward Model Evaluation on RewardBench 2
88.2FactualityScalar RM
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Scalar RMBackbone=Skywork-RM-V22026.05 | 88.2 | 67.8 | 83.1 | 97.3 | 99.2 | 83.1 | 86.4 | — | |
| LMUNITQwen2.5-72BRank=1, Unit Test Protocol=GUT per subset2024.12 | 87.2 | 54.4 | 72.7 | 91.3 | 96.8 | 90.1 | 82.1 | — | |
| LMUNITLLaMA3.1-70BRank=2, Unit Test Protocol=GUT per subset2024.12 | 84.6 | 48.8 | 71.6 | 90.7 | 97 | 90.6 | 80.5 | — | |
| Claude-opus-4Rank=4, Unit Test Protocol=GUT per subset2024.12 | 84.2 | 47.9 | 73.6 | 73.8 | 93.8 | 91.7 | 77.5 | — | |
| Claude-opus-4Rank=82024.12 | 82.7 | 41.9 | 74.9 | 89.5 | 86.2 | 83.7 | 76.5 | — | |
| LMUNITQwen2.5-72BRank=3, Unit Test Protocol=GUT2024.12 | 82.5 | 45.6 | 69.4 | 90.9 | 93.3 | 86.7 | 78.1 | — | |
| gemini-2.5-flashRank=15, Unit Test Protocol=GUT per subset2024.12 | 82.2 | 57.5 | 77.7 | 56.2 | 78.4 | 82.2 | 72.4 | — | |
| allenai/Llama-3.1-70B-Instruct-RM-RB2Rank=92024.12 | 81.3 | 41.9 | 69.9 | 88.4 | 86.5 | 88.3 | 76.1 | — | |
| QRM-Gemma-2-27BRank=62024.12 | 78.5 | 37.2 | 69.9 | 95.8 | 95.4 | 83.2 | 76.7 | — | |
| INF-ORM-Llama3.1-70BRank=72024.12 | 74.1 | 41.9 | 69.9 | 96.4 | 90.3 | 86.2 | 76.5 | — | |
| Skywork/Skywork-Reward-Gemma-2-27BRank=102024.12 | 73.7 | 40.3 | 70.5 | 94.2 | 93.2 | 82.6 | 75.8 | — | |
| Claude-3-7-sonnetRank=112024.12 | 73.3 | 54.4 | 75 | 90.3 | 92.1 | 67.2 | 75.4 | — | |
| LMUNITLLaMA3.1-70BRank=12, Unit Test Protocol=GUT2024.12 | 71.6 | 36.3 | 71 | 92.9 | 91.3 | 88 | 75.2 | — | |
| gemini-2.5-flash-preview-04-17Rank=52024.12 | 65.7 | 55.3 | 81.1 | 90.9 | 86.7 | 83.4 | 77.2 | — | |
| RUBRIC-ARMVersion=12026.05 | 48.8 | 39.1 | 63.5 | 60.8 | 66.1 | 58.2 | 56.1 | — | |
| EVOLM2026.05 | 37.2 | 30.6 | 54 | 43.5 | 54.4 | 56.1 | 46 | — | |
| SequentialTraining=IQ2026.05 | 37 | 32 | 57.1 | 42.3 | 59 | 55.6 | 47.2 | — | |
| RLCER2026.05 | 33.1 | 29.8 | 52.2 | 48.3 | 51.9 | 54.8 | 45 | — | |
| GPT-4.1Prompted=true2026.05 | 32.1 | 32.6 | 34.4 | 39.1 | 35 | 46.3 | 36.6 | — | |
| SequentialTraining=RC2026.05 | 31.5 | 30.8 | 57 | 47.9 | 49.6 | 59.2 | 46 | — | |
| Qwen3-8BPrompted=true2026.05 | 27.8 | 26.5 | 38.1 | 25 | 30.2 | 9.7 | 26.2 | — | |
| Continual Offline Training RM2026.05 | — | — | — | — | — | — | — | 75.3 | |
| HL-BTPolicy Model=Qwen2.5-3B-Instruct2026.05 | — | — | — | — | — | — | — | 74.9 | |
| HL-BTPolicy Model=Qwen3-4B-Instruct-25072026.05 | — | — | — | — | — | — | — | 75.1 | |
| Mean RewardPolicy Model=Qwen2.5-3B-Instruct2026.05 | — | — | — | — | — | — | — | 65 | |
| Mean RewardPolicy Model=Qwen3-4B-Instruct-25072026.05 | — | — | — | — | — | — | — | 65 | |
| SAVEPolicy Model=Qwen2.5-3B-Instruct2026.05 | — | — | — | — | — | — | — | 76 | |
| SAVEPolicy Model=Qwen3-4B-Instruct-25072026.05 | — | — | — | — | — | — | — | 76.1 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen2.5-3B-Instruct2026.05 | — | — | — | — | — | — | — | 75.9 | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen3-4B-Instruct-25072026.05 | — | — | — | — | — | — | — | 76.1 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen2.5-3B-Instruct2026.05 | — | — | — | — | — | — | — | 75.7 | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen3-4B-Instruct-25072026.05 | — | — | — | — | — | — | — | 76 | |
| Skywork-Reward-V2-Llama-3.2-3B2026.05 | — | — | — | — | — | — | — | 74.7 |