General Reasoning on Aggregate (AIME, MedQA, MBPP+, GPQA)
71.4Average AccuracyReLAT
Evaluation Results
| Method | Links | |
|---|---|---|
| ReLATModel=Qwen3-14B2026.06 | 71.4 | |
| LatentMASModel=Qwen3-14B2026.06 | 67.7 | |
| ReLATModel=Qwen3-8B2026.06 | 67.1 | |
| TextMASModel=Qwen3-14B2026.06 | 65.6 | |
| ReLATModel=Qwen3-4B2026.06 | 62 | |
| LatentMASModel=Qwen3-8B2026.06 | 61.1 | |
| SingleModel=Qwen3-14B2026.06 | 60.3 | |
| TextMASModel=Qwen3-8B2026.06 | 58.9 | |
| LatentMASModel=Qwen3-4B2026.06 | 57.7 | |
| TextMASModel=Qwen3-4B2026.06 | 53.1 | |
| SingleModel=Qwen3-8B2026.06 | 50.9 | |
| ReLATModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 47.7 | |
| SingleModel=Qwen3-4B2026.06 | 46.8 | |
| TextMASModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 43.3 | |
| SingleModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 40.9 | |
| LatentMASModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 34.8 |