General Reasoning on MMLU-R
84.4Accuracy (MMLU-R General Reasoning)ROSA2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ROSA2Model=Qwen3-8B2026.03 | 84.4 | — | |
| ROSAModel=Qwen3-8B2026.03 | 75.8 | — | |
| TextGradModel=Qwen3-8B2026.03 | 70.6 | — | |
| ROSA2Model=Qwen2.5-7B-Base2026.03 | 63 | — | |
| TextGradModel=Qwen2.5-7B-Base2026.03 | 60.2 | — | |
| ROSAModel=Qwen2.5-7B-Base2026.03 | 60.2 | — | |
| ROSA2Model=DeepSeek-R1-Distill-Llama-8B2026.03 | 59.4 | — | |
| BaselineModel=Qwen3-8B2026.03 | 57 | — | |
| ROSA2Model=Qwen3-0.6B-Instruct2026.03 | 50 | — | |
| ROSAModel=Qwen3-0.6B-Instruct2026.03 | 48.8 | — | |
| TextGradModel=Qwen3-0.6B-Instruct2026.03 | 46.4 | — | |
| TextGradModel=DeepSeek-R1-Distill-Llama-8B2026.03 | 43.4 | — | |
| ROSAModel=DeepSeek-R1-Distill-Llama-8B2026.03 | 42.8 | — | |
| BaselineModel=Qwen2.5-7B-Base2026.03 | 39.8 | — | |
| BaselineModel=Qwen3-0.6B-Instruct2026.03 | 24 | — | |
| BaselineModel=DeepSeek-R1-Distill-Llama-8B2026.03 | 23.6 | — | |
| ROSA2Model=Qwen2.5-0.5B-Instruct2026.03 | 18.4 | — | |
| TextGradModel=Qwen2.5-0.5B-Instruct2026.03 | 12.4 | — | |
| ROSAModel=Qwen2.5-0.5B-Instruct2026.03 | 11.4 | — | |
| BaselineModel=Qwen2.5-0.5B-Instruct2026.03 | 9.4 | — | |
| ROSAModel=Qwen3-8B, Update Location=LM Head, Reward Model=Model-based2025.09 | 0.7036 | — | |
| ROSAModel=Qwen2.5-7B-Instruct, Update Location=LM Head, Reward Model=Model-based2025.09 | 0.6847 | — | |
| ROSAModel=Qwen3-8B, Update Location=Hidden States, Reward Model=Rule-based2025.09 | 0.6837 | — | |
| ROSAModel=Qwen2.5-7B-Instruct, Update Location=Hidden States, Reward Model=Rule-based2025.09 | 0.6731 | — | |
| ROSAModel=Qwen3-8B, Update Location=LM Head, Reward Model=Rule-based2025.09 | 0.6727 | — | |
| ROSAModel=Qwen2.5-7B-Instruct, Update Location=LM Head, Reward Model=Rule-based2025.09 | 0.6217 | — | |
| BaselineModel=Qwen3-8B2025.09 | 0.5135 | — | |
| ROSAModel=DeepSeek-R1-Distill-Llama-8B, Update Location=LM Head, Reward Model=Model-based2025.09 | 0.4579 | — | |
| BaselineModel=Qwen2.5-7B-Instruct2025.09 | 0.4536 | — | |
| ROSAModel=DeepSeek-R1-Distill-Llama-8B, Update Location=Hidden States, Reward Model=Rule-based2025.09 | 0.4218 | — | |
| ROSAModel=DeepSeek-R1-Distill-Llama-8B, Update Location=LM Head, Reward Model=Rule-based2025.09 | 0.4114 | — | |
| ROSAModel=Qwen3-0.6B, Update Location=LM Head, Reward Model=Model-based2025.09 | 0.4068 | — | |
| ROSAModel=Qwen3-0.6B, Update Location=Hidden States, Reward Model=Rule-based2025.09 | 0.36 | — | |
| ROSAModel=Qwen3-0.6B, Update Location=LM Head, Reward Model=Rule-based2025.09 | 0.334 | — | |
| BaselineModel=DeepSeek-R1-Distill-Llama-8B2025.09 | 0.3046 | — | |
| BaselineModel=Qwen3-0.6B2025.09 | 0.186 | — | |
| ROSAModel=Qwen2.5-0.5B-Instruct, Update Location=LM Head, Reward Model=Model-based2025.09 | 0.1372 | — | |
| ROSAModel=Qwen2.5-0.5B-Instruct, Update Location=Hidden States, Reward Model=Rule-based2025.09 | 0.11 | — | |
| ROSAModel=Qwen2.5-0.5B-Instruct, Update Location=LM Head, Reward Model=Rule-based2025.09 | 0.0907 | — | |
| BaselineModel=Qwen2.5-0.5B-Instruct2025.09 | 0.0727 | — | |
| BaseBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | — | 76.8 | |
| BaseBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | — | 84.5 | |
| DRIFT-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Ours, Max turns=52026.05 | — | 84.6 | |
| DRIFT-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Ours, Max turns=52026.05 | — | 87.6 | |
| PPOBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | — | 78.8 | |
| PPOBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | — | 87 | |
| SCoRe-2turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=22026.05 | — | 85.4 | |
| SCoRe-2turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=22026.05 | — | 86.6 | |
| SFTBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | — | 77 | |
| SFTBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | — | 85.3 | |
| SFT-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=52026.05 | — | 78.2 | |
| SFT-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=52026.05 | — | 85.4 | |
| STaR-2turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=22026.05 | — | 84.4 | |
| STaR-2turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=22026.05 | — | 86.1 | |
| UFO-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=52026.05 | — | 87 | |
| UFO-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=52026.05 | — | 90.9 |