Mathematical Reasoning on SVAMP (Accuracy, Average Tokens)
94.1AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 94.1 | 699 | |
| CODABackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 94.1 | 187 | |
| VLPBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 94 | 264 | |
| ASRRBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 94 | 176 | |
| ASRRBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 93.1 | 350 | |
| GRPOBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 92.9 | 812 | |
| CODABackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 92.9 | 203 | |
| CODABackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 92.8 | 104 | |
| VLPBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 92.8 | 312 | |
| ASRRBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 92.8 | 272 | |
| GRPOBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 92.5 | 803 | |
| VLPBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 92.5 | 245 | |
| Qwen3-14B-BaseBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 87.1 | 361 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 81.9 | 239 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 34.8 | 2,805 |