Scientific Reasoning on GPQA (Acc, Tokens)
60.9AccuracyThoughtFold
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ThoughtFoldModel=Qwen3-14B2026.06 | 60.9 | 4,121 | |
| S-GRPOModel=Qwen3-14B2026.06 | 60.6 | 4,537 | |
| Short-RLModel=Qwen3-14B2026.06 | 59.8 | 4,685 | |
| RL + Length PenaltyModel=Qwen3-14B2026.06 | 59.4 | 4,949 | |
| S-GRPOModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 59.3 | 3,334 | |
| GRPOModel=Qwen3-14B2026.06 | 59.3 | 7,966 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 59.2 | 6,034 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 59.1 | 3,118 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 58.9 | 7,354 | |
| VanillaModel=Qwen3-14B2026.06 | 58.8 | 7,576 | |
| ThoughtFoldModel=Qwen3-8B2026.06 | 57.9 | 4,571 | |
| S-GRPOModel=Qwen3-8B2026.06 | 57.7 | 5,271 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 57.3 | 4,241 | |
| RL + Length PenaltyModel=Qwen3-8B2026.06 | 56.2 | 5,293 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-14B2026.06 | 56 | 4,380 | |
| Short-RLModel=Qwen3-8B2026.06 | 55.9 | 4,987 | |
| GRPOModel=Qwen3-8B2026.06 | 55.8 | 8,819 | |
| VanillaModel=Qwen3-8B2026.06 | 55.6 | 8,741 | |
| ThoughtFoldModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 51.9 | 3,433 | |
| S-GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 50.8 | 3,751 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 50.7 | 15,817 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 50.1 | 15,385 | |
| Short-RLModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 49.3 | 3,897 | |
| CLSRBackbone=Qwen3-8B, T (number of rounds)=32026.06 | 49.2 | 565 | |
| RL + Length PenaltyModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 49.1 | 3,984 | |
| PBrdBackbone=Qwen3-8B2026.06 | 46.1 | 922 | |
| P2SBackbone=Qwen3-8B2026.06 | 45.2 | 1,085 | |
| CoTBackbone=Qwen3-8B2026.06 | 43.8 | 973 | |
| CLSRBackbone=Qwen3-8B2026.06 | 42.6 | 228 | |
| CLSRBackbone=Qwen3-8B, T (number of rounds)=12026.06 | 40.9 | 182 |