Mathematical Reasoning on AIME 24 (Accuracy)
96.7AccuracyUniCog
Evaluation Results
| Method | Links | |
|---|---|---|
| UniCogModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 96.7 | |
| Self-VerificationModel=DeepSeek-V3.2, API Calls=O(NL)2026.01 | 94 | |
| Self-ConsistencyModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 93.3 | |
| Length-based RankingModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 93.3 | |
| StandardModel=DeepSeek-V3.2, API Calls=O(1)2026.01 | 90.7 | |
| Self-ConsistencyModel=Qwen3-8B, API Calls=O(N)2026.01 | 36.7 | |
| UniCogModel=Qwen3-8B, API Calls=O(N)2026.01 | 36.7 | |
| Self-VerificationModel=Qwen3-8B, API Calls=O(NL)2026.01 | 33.3 | |
| Self-IndicatorModel=Qwen3-8B, API Calls=O(N)2026.01 | 33.3 | |
| Perplexity-based RankingModel=Qwen3-8B, API Calls=O(N)2026.01 | 30 | |
| StandardModel=Qwen3-8B, API Calls=O(1)2026.01 | 26.7 | |
| Length-based RankingModel=Qwen3-8B, API Calls=O(N)2026.01 | 26.7 | |
| Self-VerificationModel=GPT-4o-0513, API Calls=O(NL)2026.01 | 16.7 | |
| UniCogModel=GPT-4o-0513, API Calls=O(N)2026.01 | 16.7 | |
| Length-based RankingModel=GPT-4o-0513, API Calls=O(N)2026.01 | 13.3 | |
| Self-ConsistencyModel=GPT-4o-0513, API Calls=O(N)2026.01 | 11.3 | |
| Self-VerificationModel=LLaMA-3.1-8B, API Calls=O(NL)2026.01 | 10 | |
| UniCogModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 10 | |
| StandardModel=GPT-4o-0513, API Calls=O(1)2026.01 | 8 | |
| Self-ConsistencyModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 6.7 | |
| Length-based RankingModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 6.7 | |
| Perplexity-based RankingModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 6.7 | |
| Self-IndicatorModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 6.7 | |
| StandardModel=LLaMA-3.1-8B, API Calls=O(1)2026.01 | 3.3 |