Theorem-based Question Answering on TheoremQA
86.32AccuracyMeta-reasoner
Evaluation Results
| Method | Links | |
|---|---|---|
| Meta-reasonerModel=gemini-exp-12062025.02 | 86.32 | |
| HiAR-ICLModel=gemini-exp-12062025.02 | 84.41 | |
| Meta-reasonerModel=gpt-4o-mini2025.02 | 84.13 | |
| HiAR-ICLModel=gpt-4o-mini2025.02 | 83.48 | |
| Evo-PromptModel=gpt-4o-mini2025.02 | 81.28 | |
| Evo-PromptModel=gemini-exp-12062025.02 | 80.32 | |
| Ministral-14B-Instruct-25122026.01 | 56.13 | |
| Qwen3-14BThinking=no-think2026.01 | 55.88 | |
| LLaDA-2.0-MiniTraining=T3S2026.01 | 51.5 | |
| Ling-Mini2026.01 | 50.38 | |
| Qwen3-30B-A3B-Instruct-25072026.01 | 50.12 | |
| LLaDA-2.0-MiniTraining=SFT2026.01 | 47 | |
| LLaDA-2.0-MiniTraining=Base2026.01 | 45.88 |