Reward Modeling on PPE Correlation
87.2CorrelationSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 87.2 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 83.4 | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 75.1 | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 74.7 | |
| J1-Llama-70BParadigm=LLM-as-a-Judge & Generative Reward Models, Sampling Strategy=Maj@322025.07 | 73.7 | |
| J1-Llama-70BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 72.9 | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 72.1 | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 70.5 | |
| Claude-3.5-SonnetParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 69.2 | |
| Skywork-Reward-V2-Qwen3-0.6BParadigm=Our Reward Models2025.07 | 68.3 | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 67.4 | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 67.1 | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 64.4 | |
| Llama-3-OffsetBias-RM-8BParadigm=Bradley-Terry2025.07 | 64.1 | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 63.9 | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 63.2 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models, Integration=w/ MetaRM2025.07 | 63.2 | |
| Internlm2-20b-rewardParadigm=Bradley-Terry2025.07 | 63 | |
| GRM-llama3-8B-distillParadigm=Bradley-Terry2025.07 | 62.8 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Paradigm=Bradley-Terry2025.07 | 62.5 | |
| Skywork-Reward-Gemma-2-27B-v0.2Paradigm=Bradley-Terry2025.07 | 61.9 | |
| J1-Llama-8BParadigm=LLM-as-a-Judge & Generative Reward Models, Sampling Strategy=Maj@322025.07 | 61.9 | |
| FsfairX-LLaMA3-RM-v0.1Paradigm=Bradley-Terry2025.07 | 61.1 | |
| ArmoRM-Llama3-8B-v0.1Paradigm=Bradley-Terry2025.07 | 60.6 | |
| Eurus-RM-7bParadigm=Bradley-Terry2025.07 | 60.5 | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 60.5 | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 60.4 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 60.4 | |
| QRM-Llama3.1-8B-v2Paradigm=Bradley-Terry2025.07 | 60.3 | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 60.3 | |
| Skywork-Reward-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 60.1 | |
| Internlm2-7b-rewardParadigm=Bradley-Terry2025.07 | 60 | |
| GRM-Llama3-8B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 60 | |
| J1-Llama-8BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 59.2 | |
| GRM-gemma2-2B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 58.5 | |
| BTRM Qwen2 7b 0613Paradigm=Bradley-Terry2025.07 | 58.4 | |
| Starling-RM-34BParadigm=Bradley-Terry2025.07 | 57.5 | |
| RM-Mistral-7BParadigm=Bradley-Terry2025.07 | 56.4 | |
| QRM-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 54.8 | |
| internlm2-1.8b-rewardParadigm=Bradley-Terry2025.07 | 53.6 |