Mathematical Reasoning on Math500 (Accuracy, Acc Drop)
94.81AccuracyFACT-E(Standard)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FACT-E(Standard)Backbone=DeepSeek-V32026.04 | 94.81 | — | |
| POLISHBackbone=DeepSeek-V32026.04 | 94.8 | — | |
| FACT-E(Lightweight)Backbone=Qwen3-14B2026.04 | 94.26 | — | |
| CONSISTENCYBackbone=DeepSeek-V32026.04 | 93.17 | — | |
| CoTBackbone=Qwen3-14B2026.04 | 93.17 | — | |
| POLISHBackbone=Qwen3-14B2026.04 | 92.9 | — | |
| REFLECTBackbone=Qwen3-14B2026.04 | 92.9 | — | |
| CONSISTENCYBackbone=Qwen3-14B2026.04 | 92.9 | — | |
| FACT-E(Standard)Backbone=Qwen3-14B2026.04 | 92.9 | — | |
| DENOISEBackbone=Qwen3-14B2026.04 | 92.08 | — | |
| FACT-E(Lightweight)Backbone=DeepSeek-V32026.04 | 90.32 | — | |
| MCTS (Vanilla)Base Model=Qwen2026.04 | 88.3 | — | |
| MCTS + PEBase Model=Qwen2026.04 | 88.3 | — | |
| Adaptive Parallel Monte Carlo Tree Search (Full Suite)Base Model=Qwen2026.04 | 87.6 | — | |
| REFLECTBackbone=DeepSeek-V32026.04 | 87.43 | — | |
| Beam SearchBase Model=Qwen2026.04 | 87.1 | — | |
| FACT-E(Standard)Backbone=Gpt-4o-mini2026.04 | 86.61 | — | |
| FACT-E(Lightweight)Backbone=Gpt-4o-mini2026.04 | 85.52 | — | |
| CoTBackbone=DeepSeek-V32026.04 | 85.52 | — | |
| DENOISEBackbone=DeepSeek-V32026.04 | 84.7 | — | |
| POLISHBackbone=Gpt-4o-mini2026.04 | 83.33 | — | |
| DENOISEBackbone=Gpt-4o-mini2026.04 | 83.06 | — | |
| CONSISTENCYBackbone=Gpt-4o-mini2026.04 | 82.79 | — | |
| REFLECTBackbone=Gpt-4o-mini2026.04 | 80.6 | — | |
| CoTBackbone=Gpt-4o-mini2026.04 | 78.69 | — | |
| Token-ALPevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 78.1 | — | |
| Token-MISevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 77.84 | — | |
| Seq-ALPevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 77.84 | — | |
| Seq-MISevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 77.08 | — | |
| Seq-Bypassevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 76.21 | — | |
| MCTS + PEBase Model=Llama2026.04 | 76.2 | — | |
| GRPOevaluation_protocol=average@32, temperature=1.0, max_tokens=4096, setting=Single-turn2026.03 | 75.91 | — | |
| MCTS (Vanilla)Base Model=Llama2026.04 | 75.3 | — | |
| Adaptive Parallel Monte Carlo Tree Search (Full Suite)Base Model=Llama2026.04 | 74.8 | — | |
| Beam SearchBase Model=Llama2026.04 | 72.9 | — | |
| FACT-E(Standard)Backbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 54.09 | — | |
| CoTBackbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 52.18 | — | |
| FACT-E(Lightweight)Backbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 52.18 | — | |
| CONSISTENCYBackbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 51.09 | — | |
| REFLECTBackbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 48.09 | — | |
| DENOISEBackbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 42.62 | — | |
| POLISHBackbone=ChatGPT (Gpt-3.5-turbo)2026.04 | 41 | — | |
| BF16Backbone=LongCat 560B2026.02 | 0.848 | — | |
| HiF4Backbone=LongCat 560B2026.02 | 0.826 | -2.2 | |
| HiF4Backbone=DeepSeek-V3.1 671B2026.02 | 0.802 | 5.2 | |
| NVFP4Backbone=LongCat 560B2026.02 | 0.786 | -6.2 | |
| NVFP4+PTSBackbone=DeepSeek-V3.1 671B2026.02 | 0.782 | 3.2 | |
| NVFP4+PTSBackbone=LongCat 560B2026.02 | 0.782 | -6.6 | |
| BF16Backbone=DeepSeek-V3.1 671B2026.02 | 0.75 | — | |
| NVFP4Backbone=DeepSeek-V3.1 671B2026.02 | 0.74 | -1 |