Reasoning trajectory meta-evaluation on Meta-GTA
94.64EfficiencyClaude-Sonnet-4
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude-Sonnet-4Evaluation Framework=TRACE2025.10 | 94.64 | 95.21 | 99.63 | |
| GPT-4.1Evaluation Framework=TRACE2025.10 | 94.24 | 95.4 | 97.03 | |
| o3-miniEvaluation Framework=TRACE2025.10 | 94.09 | 94.69 | 96.91 | |
| o3-miniEvaluation Framework=LLM-as-a-Judge2025.10 | 90.24 | 94.68 | 96.59 | |
| Llama-3.3-70BEvaluation Framework=TRACE2025.10 | 90.03 | 95.97 | 98.3 | |
| Claude-Sonnet-4Evaluation Framework=LLM-as-a-Judge2025.10 | 86.08 | 89.68 | 98.83 | |
| GPT-4.1Evaluation Framework=LLM-as-a-Judge2025.10 | 81.45 | 94.42 | 97.95 | |
| Llama-3.3-70BEvaluation Framework=LLM-as-a-Judge2025.10 | 76.55 | 88.95 | 98.23 | |
| Llama-3.1-8BEvaluation Framework=TRACE2025.10 | 70.46 | 93.78 | 85.28 | |
| Llama-3.1-8BEvaluation Framework=LLM-as-a-Judge2025.10 | 55.67 | 89.59 | 78.98 |