Multi-hop Question Answering on HotpotQA Easy tier distractor (val)
60.1Mean F1uniform
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| uniformStrategy=uniform, Model=gpt-4o-mini2026.05 | 60.1 | 0.0003 | 88.5 | 0.023 | — | |
| zebra-mult_offsetStrategy=zebra-mult_offset, Model=gpt-4o-mini2026.05 | 59 | 0.0003 | 86.9 | — | 0.75 | |
| zebra-additiveStrategy=zebra-additive, Model=gpt-4o-mini2026.05 | 58.9 | 0.0003 | 86.8 | 0.011 | 0.86 | |
| llmStrategy=llm, Model=gpt-4o-mini2026.05 | 52.6 | 0.0002 | 77.4 | — | 0.023 |