Math on MATH-500 (Accuracy)
99.2AccuracyGLM-4.7-Flash-T
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GLM-4.7-Flash-T#Token=37002026.04 | 99.2 | — | |
| LongCat-Flash Exp-ChatEvaluation Mode=Chat2025.12 | 98.8 | — | |
| GLM 4.6Evaluation Mode=Chat2025.12 | 98.6 | — | |
| JoyAI-LLM Flash#Token=13002026.04 | 98.2 | — | |
| Teacher-30BInference Mode=thinking2026.06 | 97.8 | — | |
| Qwen3-30B-A3B#Token=14002026.04 | 97.6 | — | |
| Latent-GRPOModel Scale=Qwen3-4B2026.01 | 97.5 | 3,108.44 | |
| Qwen3-Next-80B-A3B#Token=17002026.04 | 97.4 | — | |
| DeepSeek V3.2Evaluation Mode=Chat2025.12 | 97.2 | — | |
| OPD-T30BInference Mode=thinking2026.06 | 97.2 | — | |
| BaseModel Scale=Qwen3-4B2026.01 | 97 | — | |
| Base (SFT ckpt)Inference Mode=thinking2026.06 | 96.8 | — | |
| Qwen3.5-9BParams=9B, Sampling mode=AR2026.06 | 96.6 | — | |
| Teacher-8BInference Mode=thinking2026.06 | 96.6 | — | |
| GRPO (LLM-Judge)Model Scale=Qwen3-4B2026.01 | 96.4 | 6,753.47 | |
| LongCat-Flash ChatEvaluation Mode=Chat2025.12 | 96.4 | — | |
| RLInference Mode=thinking2026.06 | 96.4 | — | |
| OPD-T8BInference Mode=thinking2026.06 | 96 | — | |
| Qwen3.5-35B-A3B#Token=15002026.04 | 95.8 | — | |
| Qwen3.5Params=4B, Sampling mode=AR2026.06 | 95.4 | — | |
| FLARE-9BParams=9B, Sampling mode=AR-Trust2026.06 | 95.2 | — | |
| Qwen3-8BInference Mode=think2026.03 | 94.8 | — | |
| SSA-LLM-8BInference Mode=think2026.03 | 94.8 | — | |
| FLAREParams=4B, Sampling mode=AR-Trust2026.06 | 94.2 | — | |
| FLARE-9BParams=9B, Sampling mode=Diffusion-Trust2026.06 | 93.6 | — | |
| BaseModel Scale=Qwen3-1.7B2026.01 | 93.4 | — | |
| Reasoning MemoryBackbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 92.6 | — | |
| Reasoning MemoryBackbone=Qwen3-32B, Ret.=Proc., m=302026.04 | 92.3 | — | |
| Document RAG (Google)Backbone=Qwen3-32B, Ret.=Fact., m=82026.04 | 91.9 | — | |
| FLAREParams=4B, Sampling mode=Diffusion-Trust2026.06 | 91.6 | — | |
| Latent-GRPOModel Scale=Qwen3-1.7B2026.01 | 91.2 | 2,340.05 | |
| Reasoning MemoryBackbone=OpenThinker3-7B, Ret.=Proc., m=302026.04 | 91.1 | — | |
| Reasoning MemoryBackbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 90.8 | — | |
| Length ScalingBackbone=Qwen3-32B, Ret.=N/A, m=302026.04 | 90.8 | — | |
| GRPO (LLM-Judge)Model Scale=Qwen3-1.7B2026.01 | 90.6 | 4,988.84 | |
| No RAGBackbone=Qwen3-32B, Ret.=N/A, m=82026.04 | 90.5 | — | |
| Template RAG (Self-Discover)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 90.3 | — | |
| Length ScalingBackbone=Qwen3-32B, Ret.=N/A, m=82026.04 | 90.3 | — | |
| Template RAG (ReasonFlux)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 90.1 | — | |
| Document RAG (CompactDS)Backbone=Qwen3-32B, Ret.=Fact., m=82026.04 | 89.9 | — | |
| Trajectory RAG (Prefix)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 89.5 | — | |
| Trajectory RAG (Summary)Backbone=Qwen3-32B, Ret.=Proc., m=82026.04 | 89.5 | — | |
| Length ScalingBackbone=OpenThinker3-7B, Ret.=N/A, m=82026.04 | 87.6 | — | |
| Length ScalingBackbone=OpenThinker3-7B, Ret.=N/A, m=302026.04 | 87.3 | — | |
| AdaRASCategory=Steering2026.01 | 86.4 | — | |
| Document RAG (Google)Backbone=OpenThinker3-7B, Ret.=Fact., m=82026.04 | 86.4 | — | |
| Trajectory RAG (Summary)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 85.5 | — | |
| OpenReasoning-Nemotron-1.5BCategory=Post-training2026.01 | 85.4 | — | |
| ProbingCategory=Steering2026.01 | 85.4 | — | |
| SSA-LLM-8BInference Mode=no-think2026.03 | 85.4 | — | |
| CoTPrompting=Vanilla CoT, Base Model=Qwen3-1.7B2026.01 | 84.8 | — | |
| Qwen3-8BInference Mode=no-think2026.03 | 84.6 | — | |
| Document RAG (CompactDS)Backbone=OpenThinker3-7B, Ret.=Fact., m=82026.04 | 84.6 | — | |
| FLAREParams=2B, Sampling mode=AR-Trust2026.06 | 84.4 | — | |
| Qwen2.5-72BParameters=72B2026.05 | 84.2 | — | |
| No RAGBackbone=OpenThinker3-7B, Ret.=N/A, m=82026.04 | 84.1 | — | |
| Document RAG (Google)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Fact., m=82026.04 | 83.8 | — | |
| Reasoning MemoryBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 83.8 | — | |
| Reasoning MemoryBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=302026.04 | 83.6 | — | |
| Template RAG (ReasonFlux)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 83 | — | |
| Template RAG (ReasonFlux)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 82.8 | — | |
| Trajectory RAG (Prefix)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 82.8 | — | |
| Qwen2.5-32BParameters=32B2026.05 | 82.8 | — | |
| Template RAG (Self-Discover)Backbone=OpenThinker3-7B, Ret.=Proc., m=82026.04 | 82.5 | — | |
| Trajectory RAG (Summary)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 82.2 | — | |
| FLAREParams=2B, Sampling mode=Diffusion-Trust2026.06 | 82.2 | — | |
| Template RAG (Self-Discover)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 82.1 | — | |
| OpenThinker-3-1.5BCategory=Post-training2026.01 | 82 | — | |
| Kimi-Linear-48B-A3B-InstructCompression=Baseline2025.10 | 81.8 | — | |
| Document RAG (CompactDS)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Fact., m=82026.04 | 81.8 | — | |
| Length ScalingBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=82026.04 | 81.5 | — | |
| Mercury-2Params=Commercial, Sampling mode=Diffusion2026.06 | 81 | — | |
| Kimi-Linear-48B-A3B-InstructCompression=30%, Compression Method=REAP2025.10 | 80.8 | — | |
| No RAGBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=82026.04 | 80.6 | — | |
| Length ScalingBackbone=DeepSeek-R1-Distill-Llama-8B, Ret.=N/A, m=302026.04 | 80.2 | — | |
| Qwen2.5-14BParameters=14B2026.05 | 80 | — | |
| SDARParams=8B, Sampling mode=Diffusion2026.06 | 78.6 | — | |
| Trajectory RAG (Prefix)Backbone=DeepSeek-R1-Distill-Llama-8B, Ret.=Proc., m=82026.04 | 78.4 | — | |
| InternLM3-8BParameters=8B2026.05 | 78.2 | — | |
| SDAR 30B-A3BParams=30B-A3B, Sampling mode=Diffusion2026.06 | 77.8 | — | |
| BaseModel Scale=Qwen3-0.6B2026.01 | 77.6 | — | |
| FORGE-7B-MATHParameters=7B, Configuration=MATH2026.05 | 77.4 | — | |
| JoyAI-LLM Flash-Baseshots=4-shot, Decoding=Greedy2026.04 | 77 | — | |
| FORGE-7B-NP-MATHParameters=7B, Configuration=NP-MATH2026.05 | 75 | — | |
| FORGE-7B-NPParameters=7B, Configuration=NP2026.05 | 74.6 | — | |
| Qwen3-1.7B-ALLMEMModel Size=1.7B, Architecture=ALLMEM, Sliding window length=2048, Attention sinks=128, Few-shot setting=0-shot, Max tokens=327682026.02 | 74.4 | — | |
| Qwen3-8Bbackbone=Qwen3-8B2026.01 | 73.95 | — | |
| Qwen3-1.7BModel Size=1.7B, Architecture=Standard, Few-shot setting=0-shot, Max tokens=327682026.02 | 73.6 | — | |
| SDARParams=4B, Sampling mode=Diffusion2026.06 | 72.8 | — | |
| Qwen2.5-7BParameters=7B2026.05 | 72.4 | — | |
| Qwen3.5Params=2B, Sampling mode=AR2026.06 | 72.2 | — | |
| AutoMRBackbone=Qwen, Skeleton Structure=DAG2025.10 | 69.6 | — | |
| Latent-GRPOModel Scale=Qwen3-0.6B2026.01 | 67.3 | 2,280.52 | |
| Qwen2.5-3BParameters=3B2026.05 | 67.2 | — | |
| rStarBackbone=Qwen, Skeleton Structure=Tree2025.10 | 67 | — | |
| DeepSeek-R1-Distill-Qwen-1.5BCategory=Post-training2026.01 | 66.2 | — | |
| Qwen2.5-7B-SFTParameters=7B, Configuration=SFT2026.05 | 66.2 | — | |
| Typhoon-S-8Btraining=SFT+OPD with full-logits, backbone=ThaiLLM-8B2026.01 | 65.93 | — | |
| GRPO (LLM-Judge)Model Scale=Qwen3-0.6B2026.01 | 65.9 | 4,082.96 | |
| Meta-ReasonerBackbone=Qwen, Skeleton Structure=Sequential2025.10 | 65.4 | — |