Long-horizon Mathematical Reasoning on MATH (Result and Process Metrics)
89.2Result AccuracyQwen-2-72B-Instruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-2-72B-Instruct#Tok=1,440, TFLOPs=207.4, Lat. (s)=16.4, GPU DRAM Usage (GB)=> 145.02026.05 | 89.2 | — | |
| DynaGraph (Ours, 8B)#Tok=2,170, TFLOPs=34.7, Lat. (s)=24.4, GPU DRAM Usage (GB)=16.6 (O(1))2026.05 | 82.7 | — | |
| Reflexion#Tok=6,160, TFLOPs=98.6, Lat. (s)=76.4, GPU DRAM Usage (GB)=16.52026.05 | 80.5 | — | |
| Standard ToT#Tok=5,430, TFLOPs=86.9, Lat. (s)=67.6, GPU DRAM Usage (GB)=16.52026.05 | 80 | — | |
| Multi-Agent (3 × 8B)#Tok=2,470, TFLOPs=39.5, Lat. (s)=29.5, GPU DRAM Usage (GB)=> 49.52026.05 | 79.4 | — | |
| Self-Consistency (k=5)#Tok=2,730, TFLOPs=43.7, Lat. (s)=34.4, GPU DRAM Usage (GB)=16.52026.05 | 78.2 | — | |
| ReAct#Tok=4,310, TFLOPs=69.0, Lat. (s)=50.0, GPU DRAM Usage (GB)=16.52026.05 | 77.6 | — | |
| StaRPOModel=Qwen 7B2026.04 | 77.46 | 76.89 | |
| λ–GRPOModel=Qwen 7B2026.04 | 75.38 | 74.62 | |
| CPPOModel=Qwen 7B2026.04 | 74.43 | 71.97 | |
| GRPOModel=Qwen 7B2026.04 | 74.24 | 73.11 | |
| EntropyModel=Qwen 7B2026.04 | 67.61 | 65.72 | |
| Standard CoT#Tok=1,020, TFLOPs=16.3, Lat. (s)=11.8, GPU DRAM Usage (GB)=16.52026.05 | 65.4 | — | |
| StaRPOModel=Qwen 1.5B2026.04 | 56.25 | 56.06 | |
| CPPOModel=Qwen 1.5B2026.04 | 54.55 | 52.08 | |
| λ–GRPOModel=Qwen 1.5B2026.04 | 53.98 | 52.65 | |
| GRPOModel=Qwen 1.5B2026.04 | 53.6 | 49.62 | |
| OriginalModel=Qwen 7B2026.04 | 53.6 | 52.27 | |
| EntropyModel=Qwen 1.5B2026.04 | 52.65 | 50.57 | |
| PlannerModel=Qwen 7B2026.04 | 52.08 | 50.57 | |
| PlannerModel=Qwen 1.5B2026.04 | 49.81 | 47.35 | |
| OriginalModel=Qwen 1.5B2026.04 | 47.73 | 43.94 | |
| Standard Prompting#Tok=350, TFLOPs=5.6, Lat. (s)=4.2, GPU DRAM Usage (GB)=16.52026.05 | 45.5 | — |