Question Answering on Textual Reasoning Benchmarks
81.12MMLU AccuracyOurs (Qwen3-8B-Base-sft)
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Ours (Qwen3-8B-Base-sft)Model=Ours (Qwen3-8B-Base-sft)2025.11 | 81.12 | 67.45 | 81.37 | 37.88 | 95 | 87.4 | 25.73 | 20.31 | 18.33 | 39.95 | 55.45 | |
| Qwen3-8B (Non-thinking)Model=Qwen3-8B (Non-thinking)2025.11 | 78.78 | 65.39 | 80.99 | 35.9 | 93.4 | 84.8 | 25.31 | 21.25 | 16.46 | 36.18 | 53.85 | |
| Qwen3-8B-BaseModel=Qwen3-8B-Base2025.11 | 65.26 | 47.16 | 68.55 | 24.21 | 77.63 | 67.8 | 14.27 | 14.69 | 12.08 | 22.61 | 41.41 |