Multilingual Reasoning on M-IMO
39.16AccuracyROSA (+LM + M)
Evaluation Results
| Method | Links | |
|---|---|---|
| ROSA (+LM + M)Model=Qwen3-8B2025.09 | 39.16 | |
| ROSA (+HS + R)Model=Qwen3-8B2025.09 | 37.62 | |
| ROSA (+LM + R)Model=Qwen3-8B2025.09 | 33.17 | |
| ROSA (+LM + M)Model=Qwen2.5-7B-Instruct2025.09 | 21.21 | |
| BaselineModel=Qwen3-8B2025.09 | 20.37 | |
| ROSA (+HS + R)Model=Qwen2.5-7B-Instruct2025.09 | 18.36 | |
| ROSA (+LM + R)Model=Qwen2.5-7B-Instruct2025.09 | 17.57 | |
| BaselineModel=Qwen2.5-7B-Instruct2025.09 | 10.53 | |
| ROSA (+LM + M)Model=Qwen3-0.6B2025.09 | 6.6 | |
| ROSA (+LM + M)Model=DeepSeek-R1-Distill-Llama-8B2025.09 | 6.36 | |
| ROSA (+LM + R)Model=DeepSeek-R1-Distill-Llama-8B2025.09 | 6.32 | |
| ROSA (+LM + R)Model=Qwen3-0.6B2025.09 | 5.3 | |
| ROSA (+HS + R)Model=Qwen3-0.6B2025.09 | 5.3 | |
| BaselineModel=Qwen3-0.6B2025.09 | 5.2 | |
| ROSA (+HS + R)Model=DeepSeek-R1-Distill-Llama-8B2025.09 | 5.17 | |
| ROSA (+LM + M)Model=Qwen2.5-0.5B-Instruct2025.09 | 4.71 | |
| BaselineModel=DeepSeek-R1-Distill-Llama-8B2025.09 | 4.36 | |
| ROSA (+HS + R)Model=Qwen2.5-0.5B-Instruct2025.09 | 3.2 | |
| ROSA (+LM + R)Model=Qwen2.5-0.5B-Instruct2025.09 | 2.09 | |
| BaselineModel=Qwen2.5-0.5B-Instruct2025.09 | 1.99 |