Preference Classification on Anthropic HH Harmless (test)
71.7AccuracyFew-Shot
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Few-ShotJudge=Qwen3-14B, Refinement=Few-Shot2026.02 | 71.7 | 0.082 | |
| RandomJudge=Deepseek-V3, Refinement=Random2026.02 | 71.5 | 0.06 | |
| Few-ShotJudge=Deepseek-V3, Refinement=Few-Shot2026.02 | 71.5 | 0.061 | |
| SeedJudge=Deepseek-V3, Refinement=Seed2026.02 | 71.2 | 0.043 | |
| Few-ShotJudge=Gemma-3-27b-it, Refinement=Few-Shot2026.02 | 71 | 0.089 | |
| TextGradJudge=Deepseek-V3, Refinement=TextGrad2026.02 | 70.9 | 0.108 | |
| Biased Rubric SearchJudge=Deepseek-V3, Refinement=Ours2026.02 | 70.7 | 0.077 | |
| Biased Rubric SearchJudge=Gemma-3-27b-it, Refinement=Ours2026.02 | 70.1 | 0.107 | |
| RandomJudge=Gemma-3-27b-it, Refinement=Random2026.02 | 69.5 | 0.04 | |
| Biased Rubric SearchJudge=Qwen3-14B, Refinement=Ours2026.02 | 69.1 | 0.064 | |
| TextGradJudge=Gemma-3-27b-it, Refinement=TextGrad2026.02 | 68.9 | 0.064 | |
| TextGradJudge=Qwen3-14B, Refinement=TextGrad2026.02 | 68.5 | 0.072 | |
| RandomJudge=Qwen3-14B, Refinement=Random2026.02 | 67.6 | -0.01 | |
| SeedJudge=Qwen3-14B, Refinement=Seed2026.02 | 67.4 | -0.024 | |
| SeedJudge=Gemma-3-27b-it, Refinement=Seed2026.02 | 63.8 | 0.012 | |
| UMM-RMBackbone=TinyLlama-1.1B, Number of experts=62025.11 | 58.4 | — | |
| Uncertainty-Weighted OptimizationBackbone=TinyLlama-1.1B, Ensemble Strategy=ensemble RM2025.11 | 58 | — | |
| UMM-RMBackbone=TinyLlama-1.1B, Number of experts=42025.11 | 58 | — | |
| Mean OptimizationBackbone=TinyLlama-1.1B, Ensemble Strategy=ensemble RM2025.11 | 57.1 | — | |
| UMM-RMBackbone=TinyLlama-1.1B, Number of experts=22025.11 | 56.4 | — | |
| Worst-Case OptimizationBackbone=TinyLlama-1.1B, Ensemble Strategy=ensemble RM2025.11 | 55.4 | — | |
| Dense RMBackbone=TinyLlama-1.1B2025.11 | 51.2 | — |