Mathematical Reasoning on AMC 23 (Accuracy, Average Tokens)
82.2AccuracyCODA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CODABackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 82.2 | 3,684 | |
| GRPOBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 81.6 | 4,522 | |
| VLPBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 78.1 | 4,129 | |
| ASRRBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 77.5 | 2,998 | |
| CODABackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 72.5 | 4,159 | |
| GRPOBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 72.2 | 5,022 | |
| VLPBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 70 | 3,837 | |
| CODABackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 69.7 | 4,809 | |
| ASRRBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 69.1 | 3,688 | |
| VLPBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 67.5 | 4,254 | |
| GRPOBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 67.2 | 6,042 | |
| ASRRBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 66.3 | 4,022 | |
| Qwen3-14B-BaseBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 55.6 | 1,223 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 47.5 | 1,292 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 35.9 | 1,091 |