Human-Metric Correlation on RealHumanEval (Out-of-Distribution)
0.16Kendall's TauAutoMetrics
Evaluation Results
| Method | Links | |
|---|---|---|
| AutoMetricsBackbone=GPT-4o-mini2025.12 | 0.16 | |
| DnA EvalBackbone=GPT-4o-mini2025.12 | 0.152 | |
| AutoMetricsBackbone=Qwen-3-32B2025.12 | 0.145 | |
| Best Existing MetricBackbone=Model Agnostic2025.12 | 0.138 | |
| DnA EvalBackbone=Qwen-3-32B2025.12 | 0.071 | |
| LLM-JudgeBackbone=GPT-4o-mini2025.12 | 0.069 | |
| Finetuned LLMBackbone=Model Agnostic2025.12 | 0.049 | |
| MetaMetricsBackbone=Model Agnostic2025.12 | 0.025 | |
| LLM-JudgeBackbone=Qwen-3-32B2025.12 | 0.025 |