Preference Prediction on RewardBench
92.2AccuracySkywork-Critic-Llama3.1-70B
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Critic-Llama3.1-70B2026.06 | 92.2 | |
| C2Backbone=Qwen3-8B2026.04 | 91.8 | |
| Reasoning RM + External-Rubric (32B)Backbone=Qwen3-8B2026.04 | 91.3 | |
| Reasoning RM + Self-RubricBackbone=Qwen3-8B2026.04 | 90.8 | |
| SenseJudge2026.06 | 90.55 | |
| Reasoning RMBackbone=Qwen3-8B2026.04 | 89.8 | |
| Base ModelBackbone=Qwen3-8B2026.04 | 89.1 | |
| Gemini-1.5-pro-05142026.06 | 88.2 | |
| Reasoning RM + External-Rubric (32B)Backbone=Tulu3-8B-SFT2026.04 | 84.9 | |
| Gpt-4o-2024-05-132026.06 | 84.6 | |
| Meta-Llama-3.1-70B-Instruct2026.06 | 84 | |
| Claude-3-opus-202402292026.06 | 80.1 | |
| C2Backbone=Tulu3-8B-SFT2026.04 | 77.2 | |
| EvoPrefOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 75.5 | |
| ORPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 75 | |
| DPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74.9 | |
| SMS-EMOAOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74.8 | |
| EvoPref-BestOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74.8 | |
| MOEA/DOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74.5 | |
| KTOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74.1 | |
| CMA-ESOptimization Paradigm=Single-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 74 | |
| IPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 73.8 | |
| Reasoning RMBackbone=Tulu3-8B-SFT2026.04 | 73.7 | |
| Reasoning RM + Self-RubricBackbone=Tulu3-8B-SFT2026.04 | 70.8 | |
| Base ModelBackbone=Tulu3-8B-SFT2026.04 | 67.2 |