General Reasoning on Overall Aggregate
46.7Average AccuracyMENTOR
Evaluation Results
| Method | Links | |
|---|---|---|
| MENTORBackbone=Qwen2.5-7B-Base2025.10 | 46.7 | |
| QuestABackbone=Qwen2.5-7B-Base2025.10 | 44.1 | |
| On-policy RLBackbone=Qwen2.5-7B-Base2025.10 | 42.8 | |
| LUFFYBackbone=Qwen2.5-7B-Base2025.10 | 42.8 | |
| MENTORBackbone=Qwen2.5-3B-Base2025.10 | 35.3 | |
| QuestABackbone=Qwen2.5-3B-Base2025.10 | 31.8 | |
| LUFFYBackbone=Qwen2.5-3B-Base2025.10 | 31.1 | |
| On-policy RLBackbone=Qwen2.5-3B-Base2025.10 | 31 | |
| BaseBackbone=Qwen2.5-7B-Base2025.10 | 29.7 | |
| MENTORBackbone=LLaMa3.1-8B-Base2025.10 | 23.8 | |
| LUFFYBackbone=LLaMa3.1-8B-Base2025.10 | 21.5 | |
| On-policy RLBackbone=LLaMa3.1-8B-Base2025.10 | 20.6 | |
| QuestABackbone=LLaMa3.1-8B-Base2025.10 | 19 | |
| BaseBackbone=Qwen2.5-3B-Base2025.10 | 17.1 | |
| BaseBackbone=LLaMa3.1-8B-Base2025.10 | 2.1 |