General Utility Evaluation on MT_Bench
82.7Agreement RateC2PO
Evaluation Results
| Method | Links | |
|---|---|---|
| C2POBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 82.7 | |
| RubricHubJudge Model=Claude Sonnet 4, Approach Type=Training-free Approach2026.05 | 81.72 | |
| Human-crafted (existing) RubricsJudge Model=Claude Sonnet 4, Rubric Granularity=Dataset-specific2026.05 | 81.62 | |
| Training-free Rubric GenerationJudge Model=Claude Sonnet 4, Rubric Granularity=Instance-specific2026.05 | 81.62 | |
| DnA-EvalJudge Model=Claude Sonnet 4, Approach Type=Training-free Approach2026.05 | 81.51 | |
| Training-free Rubric GenerationJudge Model=Llama 3.1 70B, Rubric Granularity=Instance-specific2026.05 | 80.98 | |
| Human-crafted (existing) RubricsJudge Model=Llama 3.1 70B, Rubric Granularity=Dataset-specific2026.05 | 80.87 | |
| Training-free Rubric GenerationJudge Model=Qwen3 14B, Rubric Granularity=Instance-specific2026.05 | 80.55 | |
| Training-free Rubric GenerationJudge Model=Claude Sonnet 4, Rubric Granularity=Dataset-specific2026.05 | 80.55 | |
| RubricHubJudge Model=Llama 3.1 70B, Approach Type=Training-free Approach2026.05 | 80.34 | |
| Training-free Rubric GenerationJudge Model=Qwen3 14B, Rubric Granularity=Dataset-specific2026.05 | 80.02 | |
| Human-crafted (existing) RubricsJudge Model=Qwen3 14B, Rubric Granularity=Dataset-specific2026.05 | 79.91 | |
| Training-free Rubric GenerationJudge Model=Llama 3.1 70B, Rubric Granularity=Dataset-specific2026.05 | 79.91 | |
| CPOBackbone=LLaMA-2-13B-Chat2025.12 | 79.9 | |
| C2POBackbone=LLaMA-2-13B-Chat2025.12 | 79.9 | |
| RubricHubJudge Model=Qwen3 14B, Approach Type=Training-free Approach2026.05 | 79.76 | |
| DnA-EvalJudge Model=Qwen3 14B, Approach Type=Training-free Approach2026.05 | 78.8 | |
| DnA-EvalJudge Model=Llama 3.1 70B, Approach Type=Training-free Approach2026.05 | 77.15 | |
| CPOBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 77.1 | |
| CheckEvalJudge Model=Qwen3 14B, Approach Type=Training-free Approach2026.05 | 75.24 | |
| IPOBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 74.2 | |
| Prometheus 8x7BApproach Type=Fine-tuned Model, Rubric Granularity=Dataset-specific2026.05 | 74.18 | |
| CheckEvalJudge Model=Claude Sonnet 4, Approach Type=Training-free Approach2026.05 | 73.06 | |
| CheckEvalJudge Model=Llama 3.1 70B, Approach Type=Training-free Approach2026.05 | 71.04 | |
| IPOBackbone=LLaMA-2-13B-Chat2025.12 | 67.3 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 67 | |
| BCOBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 64.7 | |
| DPOBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 64.2 | |
| BCOBackbone=LLaMA-2-13B-Chat2025.12 | 60.3 | |
| DPOBackbone=LLaMA-2-13B-Chat2025.12 | 48.5 | |
| FRBackbone=LLaMA-2-13B-Chat2025.12 | 45.4 | |
| FRBackbone=DeepSeek-R1-Distill-Qwen-14B2025.12 | 39.7 | |
| GRPOBackbone=LLaMA-2-13B-Chat2025.12 | 33.5 |