Scientific Reasoning on HLE (test)
49Pass@1GPT-5.4-xhigh
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.4-xhighSize=—, # Reas. Tokens=4821.8, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 49 | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=8810.3, Reasoning Paradigm=Reasoning LLMs2026.05 | 40.8 | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=3011.5, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 39.6 | |
| Kimi-K2.5Size=1024B, # Reas. Tokens=6413.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 34.4 | |
| Tongyi-DeepResearchSize=30B, # Reas. Tokens=7431.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 31.6 | |
| SR2AM-v1.0-30BSize=30B, # Reas. Tokens=5517.7, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 30.4 | |
| MiroThinker-v1.5Size=30B, # Reas. Tokens=11295.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 30 | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=9306.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 24 | |
| GPT-OSS-120B-highSize=120B, # Reas. Tokens=2700.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 20.4 | |
| GLM-4.6Size=357B, # Reas. Tokens=3580.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 19 | |
| ASearcher-Web-QWQ-v2Size=32B, # Reas. Tokens=116752.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 16.4 | |
| WebExplorer-8BSize=8B, # Reas. Tokens=3616.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 14.8 | |
| SR2AM-v0.1-8BSize=8B, # Reas. Tokens=3697.6, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 14.2 | |
| WebSailor-32BSize=32B, # Reas. Tokens=1055.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 12.2 | |
| Qwen3-235BSize=235B, # Reas. Tokens=6467.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 12 | |
| K2-Think-V2-highSize=73B, # Reas. Tokens=31905.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 11.6 | |
| A2FMSize=32B, # Reas. Tokens=23424.8, Reasoning Paradigm=Mode Routing2026.05 | 10.3 | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=8269.1, Reasoning Paradigm=Reasoning LLMs2026.05 | 10.2 | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=5410.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 9.8 | |
| WebSailor-7BSize=7B, # Reas. Tokens=2211.5, Reasoning Paradigm=Unregulated Deliberation2026.05 | 9.4 | |
| AFM-Web-7B-RLSize=7B, # Reas. Tokens=2608.6, Reasoning Paradigm=Workflow Distillation2026.05 | 7.8 | |
| ASearcher-Web-7BSize=7B, # Reas. Tokens=601.4, Reasoning Paradigm=Unregulated Deliberation2026.05 | 6.8 | |
| SimpleTIR-7BSize=7B, # Reas. Tokens=3551.7, Reasoning Paradigm=Unregulated Deliberation2026.05 | 4.6 | |
| SimpleTIR-32BSize=32B, # Reas. Tokens=5174.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 3.6 | |
| AFM-Code-7B-RLSize=7B, # Reas. Tokens=11205.5, Reasoning Paradigm=Workflow Distillation2026.05 | 2.8 |