Multi-domain Question Answering on MMLU-ST
89.6AccuracyOuro2.6B-Thinking + RLTT
Evaluation Results
| Method | Links | |
|---|---|---|
| Ouro2.6B-Thinking + RLTT2026.02 | 89.6 | |
| Ouro2.6B-Thinking + GRPO2026.02 | 86.1 | |
| Ouro2.6B-Thinking + SFT2026.02 | 85.2 | |
| Ouro2.6B-Thinking2026.02 | 84.4 | |
| Qwen3 – 4B2026.02 | 77.1 | |
| DeepSeekR1 – 7B2026.02 | 74.4 | |
| Qwen3 – 1.7B2026.02 | 71.4 | |
| DeepSeekR1 – 1.5B2026.02 | 54.5 |