Reasoning trajectory meta-evaluation on Meta-m&m's
88.56Efficiencyo3-mini
Evaluation Results
| Method | Links | |
|---|---|---|
| o3-miniEvaluation Framework=TRACE2025.10 | 88.56 | |
| o3-miniEvaluation Framework=LLM-as-a-Judge2025.10 | 88.13 | |
| Llama-3.3-70BEvaluation Framework=TRACE2025.10 | 87.19 | |
| Llama-3.3-70BEvaluation Framework=LLM-as-a-Judge2025.10 | 86.47 | |
| GPT-4.1Evaluation Framework=TRACE2025.10 | 86.12 | |
| Claude-Sonnet-4Evaluation Framework=LLM-as-a-Judge2025.10 | 86.08 | |
| Claude-Sonnet-4Evaluation Framework=TRACE2025.10 | 85.75 | |
| GPT-4.1Evaluation Framework=LLM-as-a-Judge2025.10 | 84.35 | |
| Llama-3.1-8BEvaluation Framework=TRACE2025.10 | 64.05 | |
| Llama-3.1-8BEvaluation Framework=LLM-as-a-Judge2025.10 | 44.61 |