Reasoning on HotPotQA
66ACC1ChatGPT o1-mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ChatGPT o1-miniModel=o1-mini2024.12 | 66 | — | 9.1 | |
| ChatGPT 4oModel=4o2024.12 | 65 | 2 | 17.9 | |
| TEPOdenseBackbone=Llama3.1-8B-Instruct2026.02 | 64.6 | — | — | |
| ARPOBackbone=Llama3.1-8B-Instruct2026.02 | 63.2 | — | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.02 | 62.7 | — | — | |
| TEPOdenseBackbone=Qwen2.5-7B-Instruct2026.02 | 62.1 | — | — | |
| TEPOsparseBackbone=Llama3.1-8B-Instruct2026.02 | 60.6 | — | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 60.3 | — | — | |
| TEPOsparseBackbone=Qwen2.5-7B-Instruct2026.02 | 60.1 | — | — | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 59.6 | — | — | |
| SFTBackbone=Llama3.1-8B-Instruct2026.02 | 59.4 | — | — | |
| AEPOBackbone=Qwen2.5-7B-Instruct2026.02 | 58.3 | — | — | |
| ARPOBackbone=Qwen2.5-7B-Instruct2026.02 | 56.83 | — | — | |
| ChatGPT 3.5-turboModel=3.5-turbo2024.12 | 55 | 6 | 19.7 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct2026.02 | 47.7 | — | — | |
| Llama3.1-8B-InstructBackbone=Llama3.1-8B-Instruct2026.02 | 46.7 | — | — | |
| AutoTool (Qwen3-8B)Size=8B, Backbone=Qwen32025.12 | 45.1 | — | — | |
| Search-R1Size=7B2025.12 | 43.3 | — | — | |
| GPT4oSize=-2025.12 | 38.7 | — | — | |
| AutoTool (Qwen2.5-VL-7B)Size=7B, Backbone=Qwen2.5-VL2025.12 | 33.2 | — | — | |
| QwQ-32BSize=32B2025.12 | 32.6 | — | — | |
| DeepSeek-R1-Distill-Qwen-14BSize=14B2025.12 | 24.2 | — | — | |
| Qwen2.5-Math-72B-InstructSize=72B2025.12 | 23.7 | — | — | |
| ReToolSize=32B2025.12 | 21.4 | — | — | |
| Qwen2.5-VL-72B-InstructSize=72B2025.12 | 13.9 | — | — |