Token Consumption and Cost on HotpotQA Multi-hop Reasoning
1Relative CostCoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoTEvaluation Model=GPT-4o-mini2026.03 | 1 | 1,259 | |
| Analogical PromptingEvaluation Model=GPT-4o-mini2026.03 | 1.03 | — | |
| TDA-RCEvaluation Model=GPT-4o-mini2026.03 | 1.14 | — | |
| Role / Persona PromptingEvaluation Model=GPT-4o-mini2026.03 | 1.16 | — | |
| Instruction InductionEvaluation Model=GPT-4o-mini2026.03 | 1.19 | — | |
| Prompt CanvasEvaluation Model=GPT-4o-mini2026.03 | 1.19 | — | |
| HoTEvaluation Model=GPT-4o-mini2026.03 | 1.26 | — | |
| Self-RefineEvaluation Model=GPT-4o-mini2026.03 | 2.68 | — | |
| AoTEvaluation Model=GPT-4o-mini2026.03 | 3.68 | — | |
| AFlowEvaluation Model=GPT-4o-mini2026.03 | 4.59 | — | |
| CoT-SCEvaluation Model=GPT-4o-mini, n=52026.03 | 5.12 | — | |
| ToTEvaluation Model=GPT-4o-mini2026.03 | 6.63 | — | |
| GoTEvaluation Model=GPT-4o-mini2026.03 | 6.87 | — | |
| FoTEvaluation Model=GPT-4o-mini, n=82026.03 | 8.04 | — |