Mathematical Reasoning on MATH 500 (Accuracy, Tokens)
97.4AccuracyThoughtFold
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ThoughtFoldModel=Qwen3-8B2026.06 | 97.4 | 2,933 | |
| ThoughtFoldModel=Qwen3-14B2026.06 | 97.1 | 2,577 | |
| Short-RLModel=Qwen3-14B2026.06 | 96.4 | 2,789 | |
| S-GRPOModel=Qwen3-14B2026.06 | 96.4 | 2,652 | |
| GRPOModel=Qwen3-14B2026.06 | 95.8 | 5,140 | |
| RL + Length PenaltyModel=Qwen3-14B2026.06 | 95.8 | 2,866 | |
| S-GRPOModel=Qwen3-8B2026.06 | 95.2 | 3,166 | |
| VanillaModel=Qwen3-14B2026.06 | 95.2 | 5,078 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 94.4 | 2,089 | |
| GRPOModel=Qwen3-8B2026.06 | 94.4 | 5,440 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 94.2 | 1,956 | |
| RL + Length PenaltyModel=Qwen3-8B2026.06 | 94.2 | 3,247 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 93.6 | 5,317 | |
| S-GRPOModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 93.6 | 2,146 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 93.5 | 3,844 | |
| VanillaModel=Qwen3-8B2026.06 | 93.4 | 5,577 | |
| Short-RLModel=Qwen3-8B2026.06 | 93.2 | 3,048 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 93.1 | 2,021 | |
| S-GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 92.4 | 2,252 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 92.4 | 1,993 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 92.2 | 2,451 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 91.7 | 2,234 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 85.8 | 5,590 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 84 | 4,471 |