Human-Metric Correlation on SimpEval In-Distribution
0.321Kendall's TauAutoMetrics
Evaluation Results
| Method | Links | |
|---|---|---|
| AutoMetricsBackbone=GPT-4o-mini2025.12 | 0.321 | |
| AutoMetricsBackbone=Qwen-3-32B2025.12 | 0.316 | |
| LLM-JudgeBackbone=Qwen-3-32B2025.12 | 0.294 | |
| LLM-JudgeBackbone=GPT-4o-mini2025.12 | 0.272 | |
| Best Existing MetricBackbone=Model Agnostic2025.12 | 0.246 | |
| DnA EvalBackbone=GPT-4o-mini2025.12 | 0.234 | |
| MetaMetricsBackbone=Model Agnostic2025.12 | 0.127 | |
| Finetuned LLMBackbone=Model Agnostic2025.12 | 0.076 | |
| DnA EvalBackbone=Qwen-3-32B2025.12 | 0.042 |