Reasoning Question Answering on FinQA (test)
76.9Precision@1GPT-5.4-xhigh
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5.4-xhighSize=—, # Reas. Tokens=4821.8, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 76.9 | — | — | |
| GPT-5.4-xhighSize=—, # Reas. Tokens=8810.3, Reasoning Paradigm=Reasoning LLMs2026.05 | 76.5 | — | — | |
| K2-Think-V2-highSize=73B, # Reas. Tokens=31905.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 74.5 | — | — | |
| SR2AM-v0.1-8BSize=8B, # Reas. Tokens=3697.6, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 73.6 | — | — | |
| SR2AM-v1.0-30BSize=30B, # Reas. Tokens=5517.7, Reasoning Paradigm=Self-Regulated Simulative Reasoning2026.05 | 73.4 | — | — | |
| GLM-4.6Size=357B, # Reas. Tokens=3580.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 73.1 | — | — | |
| MiroThinker-v1.5Size=30B, # Reas. Tokens=11295.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 72.7 | — | — | |
| GPT-OSS-120B-highSize=120B, # Reas. Tokens=2700.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 72.3 | — | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=9306.2, Reasoning Paradigm=Reasoning LLMs2026.05 | 72.2 | — | — | |
| DeepSeek-V3.2Size=685B, # Reas. Tokens=3011.5, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 72 | — | — | |
| Kimi-K2.5Size=1024B, # Reas. Tokens=6413.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 71.6 | — | — | |
| A2FMSize=32B, # Reas. Tokens=23424.8, Reasoning Paradigm=Mode Routing2026.05 | 70.3 | — | — | |
| ASearcher-Web-QWQ-v2Size=32B, # Reas. Tokens=116752.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 67.5 | — | — | |
| Qwen3-235BSize=235B, # Reas. Tokens=6467.4, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 67.2 | — | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=5410.1, Reasoning Paradigm=Pretrained LLMs + Tools2026.05 | 67.1 | — | — | |
| WebExplorer-8BSize=8B, # Reas. Tokens=3616.9, Reasoning Paradigm=Unregulated Deliberation2026.05 | 65.8 | — | — | |
| AFM-Code-7B-RLSize=7B, # Reas. Tokens=11205.5, Reasoning Paradigm=Workflow Distillation2026.05 | 65.1 | — | — | |
| SimpleTIR-32BSize=32B, # Reas. Tokens=5174.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 64.7 | — | — | |
| Qwen3-30B-A3BSize=30B, # Reas. Tokens=8269.1, Reasoning Paradigm=Reasoning LLMs2026.05 | 64.2 | — | — | |
| WebSailor-32BSize=32B, # Reas. Tokens=1055.2, Reasoning Paradigm=Unregulated Deliberation2026.05 | 62.4 | — | — | |
| SimpleTIR-7BSize=7B, # Reas. Tokens=3551.7, Reasoning Paradigm=Unregulated Deliberation2026.05 | 55.4 | — | — | |
| AFM-Web-7B-RLSize=7B, # Reas. Tokens=2608.6, Reasoning Paradigm=Workflow Distillation2026.05 | 53.7 | — | — | |
| ASearcher-Web-7BSize=7B, # Reas. Tokens=601.4, Reasoning Paradigm=Unregulated Deliberation2026.05 | 45.9 | — | — | |
| Tongyi-DeepResearchSize=30B, # Reas. Tokens=7431.8, Reasoning Paradigm=Unregulated Deliberation2026.05 | 45.8 | — | — | |
| GARLq=0.75, Setup=cold-start (no prompts)2026.04 | 30.5 | 61.1 | 38.3 | |
| GARLq=1, Setup=cold-start (no prompts)2026.04 | 21.9 | 58.7 | 33.5 | |
| GRPOSetup=warm-start (prompted)2026.04 | 18.9 | 48.4 | 26.9 | |
| WebSailor-7BSize=7B, # Reas. Tokens=2211.5, Reasoning Paradigm=Unregulated Deliberation2026.05 | 18.5 | — | — |