Accuracy (%) on Reasoning on HLE
40.8Accuracy (HLE Reasoning)DeepSeek-V3.2
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-V3.2Context Window=128k, Memory Mechanism=Disabled2026.04 | 40.8 | |
| OpenAI-GPT-5-highContext Window=128k, Memory Mechanism=Disabled2026.04 | 35.2 | |
| Tongyi DeepResearch 30BContext Window=128k, Memory Mechanism=Disabled2026.04 | 32.9 | |
| Minimax-M2Context Window=128k, Memory Mechanism=Disabled2026.04 | 31.8 | |
| GLM-4.6Context Window=128k, Memory Mechanism=Disabled2026.04 | 30.4 | |
| DeepSeek-V3.1Context Window=128k, Memory Mechanism=Disabled2026.04 | 29.8 | |
| SFR-DeepResearchContext Window=128k, Memory Mechanism=Disabled2026.04 | 28.7 | |
| Kimi-ResearcherContext Window=128k, Memory Mechanism=Disabled2026.04 | 26.9 | |
| Qwen3.5-122B-A10BTool Use=no tools2026.04 | 25.3 | |
| Claude-4.5-SonnetContext Window=128k, Memory Mechanism=Disabled2026.04 | 24.5 | |
| Nemotron 3 SuperTool Use=with tools2026.04 | 22.82 | |
| LiteResearcher-4BContext Window=128k, Memory Mechanism=Disabled2026.04 | 22 | |
| Kimi-K2-0905Context Window=128k, Memory Mechanism=Disabled2026.04 | 21.7 | |
| Mirothinker 8BContext Window=128k, Memory Mechanism=Disabled2026.04 | 21.5 | |
| Claude-4-SonnetContext Window=128k, Memory Mechanism=Disabled2026.04 | 20.3 | |
| AgentCPM-Explore-4BContext Window=128k, Memory Mechanism=Disabled2026.04 | 19.1 | |
| GPT-OSS-120BTool Use=with tools2026.04 | 19 | |
| Nemotron 3 SuperTool Use=no tools2026.04 | 18.26 | |
| AFM-RL-32BContext Window=128k, Memory Mechanism=Disabled2026.04 | 18 | |
| WebExplorer-8BContext Window=128k, Memory Mechanism=Disabled2026.04 | 17.3 | |
| GPT-OSS-120BTool Use=no tools2026.04 | 14.9 | |
| DGO (TTS)Model=Qwen3-14B-Base, Inference Mode=Test-Time Scaling2026.03 | 7.71 | |
| DGO (TTS)Model=Qwen3-8B-Base, Inference Mode=Test-Time Scaling2026.03 | 6.51 | |
| DGO (zero)Model=Qwen3-14B-Base, Inference Mode=Intrinsic Inference2026.03 | 5.63 | |
| DAPOModel=Qwen3-14B-Base2026.03 | 5.45 | |
| SGT (DPO Iteration 5)Actor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_5 → πA2026.04 | 5.3 | |
| GRPOModel=Qwen3-14B-Base2026.03 | 5.15 | |
| SFTModel=Qwen3-14B-Base2026.03 | 4.96 | |
| Prompted SupplementActor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_prompt → πA2026.04 | 4.9 | |
| SGT (DPO Iteration 3)Actor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_3 → πA2026.04 | 4.8 | |
| SGT (DPO Iteration 1)Actor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_1 → πA2026.04 | 4.8 | |
| SGT (DPO Iteration 2)Actor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_2 → πA2026.04 | 4.8 | |
| DAPOModel=Qwen3-8B-Base2026.03 | 4.66 | |
| Supplement Solver OnlyActor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=∅ → πS_solve2026.04 | 4.6 | |
| Prompted SupplementActor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_prompt → πA2026.04 | 4.6 | |
| Supplement Solver OnlyActor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=∅ → πS_solve2026.04 | 4.6 | |
| SGT (DPO Iteration 4)Actor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_4 → πA2026.04 | 4.6 | |
| DGO (TTS)Model=Qwen3-4B-Base, Inference Mode=Test-Time Scaling2026.03 | 4.45 | |
| SGT (DPO Iteration 5)Actor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_5 → πA2026.04 | 4.4 | |
| SFT SupplementActor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_SFT → πA2026.04 | 4.4 | |
| SFTModel=Qwen3-8B-Base2026.03 | 4.34 | |
| SGT (DPO Iteration 3)Actor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_3 → πA2026.04 | 4.2 | |
| DGO (zero)Model=Qwen3-8B-Base, Inference Mode=Intrinsic Inference2026.03 | 4.02 | |
| GRPOModel=Qwen3-8B-Base2026.03 | 3.95 | |
| DSPyActor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_DSPy → πA2026.04 | 3.9 | |
| TextGradActor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_TG → πA2026.04 | 3.7 | |
| SGT (DPO Iteration 4)Actor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_4 → πA2026.04 | 3.7 | |
| Inference-time scaling (ITS)Actor Model=gpt-oss-120b, Supplement Model=None, Supplement Generation Method=∅ → πA_ITS2026.04 | 3.7 | |
| Baseline ActorActor Model=v3.5-sonnet-v2, Supplement Model=None, Supplement Generation Method=∅ → πA2026.04 | 3.5 | |
| DGO (zero)Model=Qwen3-4B-Base, Inference Mode=Intrinsic Inference2026.03 | 3.37 | |
| EGIModel=Qwen3-14B-Base2026.03 | 3.29 | |
| EGIModel=Qwen3-8B-Base2026.03 | 3.12 | |
| SGT (DPO Iteration 2)Actor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_2 → πA2026.04 | 3 | |
| SGT (DPO Iteration 1)Actor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_1 → πA2026.04 | 2.8 | |
| GRPOModel=Qwen3-4B-Base2026.03 | 2.73 | |
| SFTModel=Qwen3-4B-Base2026.03 | 2.56 | |
| SFT SupplementActor Model=v3.5-sonnet-v2, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_SFT → πA2026.04 | 2.5 | |
| Baseline ActorActor Model=gpt-oss-120b, Supplement Model=None, Supplement Generation Method=∅ → πA2026.04 | 2.5 | |
| DSPyActor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_DSPy → πA2026.04 | 2.5 | |
| DAPOModel=Qwen3-4B-Base2026.03 | 2.34 | |
| Inference-time scaling (ITS)Actor Model=v3.5-sonnet-v2, Supplement Model=None, Supplement Generation Method=∅ → πA_ITS2026.04 | 1.9 | |
| TextGradActor Model=gpt-oss-120b, Supplement Model=Qwen3-1.7B, Supplement Generation Method=πS_TG → πA2026.04 | 1.9 | |
| EGIModel=Qwen3-4B-Base2026.03 | 1.31 |