Pairwise Evaluation on MT-Bench
83.69Human Agreement RateFine-tuned Rubric Generator
Evaluation Results
| Method | Links | |
|---|---|---|
| Fine-tuned Rubric GeneratorJudge=Claude Sonnet 4, Iteration=22026.05 | 83.69 | |
| Fine-tuned Rubric GeneratorJudge=Claude Sonnet 4, Iteration=12026.05 | 83.35 | |
| Fine-tuned Rubric GeneratorJudge=Llama 3.1 70B, Iteration=22026.05 | 82.93 | |
| Fine-tuned Rubric GeneratorJudge=Qwen3 14B, Iteration=22026.05 | 82.87 | |
| Fine-tuned Rubric GeneratorJudge=Llama 3.1 70B, Iteration=12026.05 | 82.72 | |
| Fine-tuned Rubric GeneratorJudge=Qwen3 14B, Iteration=12026.05 | 82.62 | |
| Highest Training-freeJudge=Claude Sonnet 42026.05 | 81.72 | |
| Highest Training-freeJudge=Llama 3.1 70B2026.05 | 80.98 | |
| Highest Training-freeJudge=Qwen3 14B2026.05 | 80.55 |