General Reasoning on GPQA (Accuracy, Average Tokens)
50.6AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 50.6 | 2,959 | |
| CODABackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 50.6 | 1,756 | |
| VLPBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 50.4 | 1,981 | |
| ASRRBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 48.8 | 1,202 | |
| CODABackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 47.2 | 2,047 | |
| GRPOBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 47.1 | 3,399 | |
| VLPBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 47 | 2,002 | |
| ASRRBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 46.5 | 1,814 | |
| Qwen3-14B-BaseBackbone=Qwen3-14B, Sampling Strategy=mean@82026.03 | 43.7 | 841 | |
| GRPOBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 42.6 | 3,182 | |
| CODABackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 42.6 | 1,656 | |
| VLPBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 42.5 | 1,983 | |
| ASRRBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 39.5 | 1,984 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=mean@82026.03 | 36.3 | 1,034 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B, Sampling Strategy=mean@82026.03 | 31.2 | 1,910 |