Multi-task Evaluation on Aggregate (GSM8K, BFCL, Spider, HumanEval)
79.4Average AccuracyRLSTA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RLSTAModel=Qwen2.5-7B-Instruct, Evaluation Protocol=FULL2026.05 | 79.4 | — | |
| BaseModel=Qwen2.5-7B-Instruct, Evaluation Protocol=FULL2026.05 | 79.3 | — | |
| GRPOModel=Qwen2.5-7B-Instruct, Evaluation Protocol=FULL2026.05 | 79 | — | |
| MAIGOModel=Qwen2.5-7B-Instruct, Evaluation Protocol=FULL2026.05 | 78.6 | — | |
| SFTModel=Qwen2.5-7B-Instruct, Evaluation Protocol=FULL2026.05 | 77.5 | — | |
| MAIGOModel=Qwen2.5-3B-Instruct, Evaluation Protocol=FULL2026.05 | 67.5 | — | |
| MAIGOModel=Qwen2.5-7B-Instruct, Evaluation Protocol=SHARDED2026.05 | 66.1 | 84.1 | |
| BaseModel=Qwen2.5-3B-Instruct, Evaluation Protocol=FULL2026.05 | 66 | — | |
| RLSTAModel=Qwen2.5-3B-Instruct, Evaluation Protocol=FULL2026.05 | 65.6 | — | |
| GRPOModel=Qwen2.5-3B-Instruct, Evaluation Protocol=FULL2026.05 | 63.8 | — | |
| SFTModel=Qwen2.5-3B-Instruct, Evaluation Protocol=FULL2026.05 | 63.3 | — | |
| MAIGOModel=Qwen2.5-3B-Instruct, Evaluation Protocol=SHARDED2026.05 | 58.2 | 86.3 | |
| RLSTAModel=Qwen2.5-7B-Instruct, Evaluation Protocol=SHARDED2026.05 | 57.6 | 72.5 | |
| GRPOModel=Qwen2.5-7B-Instruct, Evaluation Protocol=SHARDED2026.05 | 55.2 | 69.9 | |
| SFTModel=Qwen2.5-7B-Instruct, Evaluation Protocol=SHARDED2026.05 | 53 | 68.4 | |
| BaseModel=Qwen2.5-7B-Instruct, Evaluation Protocol=SHARDED2026.05 | 52.8 | 66.5 | |
| RLSTAModel=Qwen2.5-3B-Instruct, Evaluation Protocol=SHARDED2026.05 | 47.9 | 73.1 | |
| GRPOModel=Qwen2.5-3B-Instruct, Evaluation Protocol=SHARDED2026.05 | 46.1 | 72.3 | |
| BaseModel=Qwen2.5-3B-Instruct, Evaluation Protocol=SHARDED2026.05 | 43.5 | 66 | |
| SFTModel=Qwen2.5-3B-Instruct, Evaluation Protocol=SHARDED2026.05 | 43.3 | 68.4 |