Scientific Reasoning on SuperGPQA (test)
77.7Pass@1GPT-5.4-xhigh
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.4-xhighSize=—, # Reas. Tokens=4821.8, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 77.7 | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=3011.5, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 75 | |
| MiroThinker-v1.5Size=30B, # Reas. Tokens=11295.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 73.7 | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=8810.3, Reasoning Paradigm=Reasoning LLMs2026.05 | 73.5 | |
| SR2AM-v1.0-30BSize=30B, # Reas. Tokens=5517.7, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 73 | |
| Kimi-K2.5Size=1024B, # Reas. Tokens=6413.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 72.5 | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=9306.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 71.8 | |
| GLM-4.6Size=357B, # Reas. Tokens=3580.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 67 | |
| Qwen3-235BSize=235B, # Reas. Tokens=6467.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 66.3 | |
| ASearcher-Web-QWQ-v2Size=32B, # Reas. Tokens=116752.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 65 | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=8269.1, Reasoning Paradigm=Reasoning LLMs2026.05 | 63.1 | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=5410.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 62.4 | |
| WebExplorer-8BSize=8B, # Reas. Tokens=3616.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 60.3 | |
| GPT-OSS-120B-highSize=120B, # Reas. Tokens=2700.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 58.6 | |
| K2-Think-V2-highSize=73B, # Reas. Tokens=31905.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 58 | |
| SR2AM-v0.1-8BSize=8B, # Reas. Tokens=3697.6, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 58 | |
| A2FMSize=32B, # Reas. Tokens=23424.8, Reasoning Paradigm=Mode Routing2026.05 | 55.3 | |
| Tongyi-DeepResearchSize=30B, # Reas. Tokens=7431.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 54.9 | |
| SimpleTIR-32BSize=32B, # Reas. Tokens=5174.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 50.5 | |
| WebSailor-32BSize=32B, # Reas. Tokens=1055.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 47.3 | |
| SimpleTIR-7BSize=7B, # Reas. Tokens=3551.7, Reasoning Paradigm=Unregulated Deliberation2026.05 | 41.7 | |
| ASearcher-Web-7BSize=7B, # Reas. Tokens=601.4, Reasoning Paradigm=Unregulated Deliberation2026.05 | 35.7 | |
| AFM-Web-7B-RLSize=7B, # Reas. Tokens=2608.6, Reasoning Paradigm=Workflow Distillation2026.05 | 32.4 | |
| WebSailor-7BSize=7B, # Reas. Tokens=2211.5, Reasoning Paradigm=Unregulated Deliberation2026.05 | 28 | |
| AFM-Code-7B-RLSize=7B, # Reas. Tokens=11205.5, Reasoning Paradigm=Workflow Distillation2026.05 | 23.6 |