Multi-hop Question Answering on HotpotQA Hard tier distractor (val)
34.7Mean F1zebra-additive
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| zebra-additiveStrategy=zebra-additive, Model=gpt-4o-mini2026.05 | 34.7 | 0.0003 | 97.8 | 0.0016 | 0.44 | |
| uniformStrategy=uniform, Model=gpt-4o-mini2026.05 | 33.5 | 0.0003 | 94.4 | 0.006 | — | |
| zebra-mult_offsetStrategy=zebra-mult_offset, Model=gpt-4o-mini2026.05 | 33.1 | 0.0003 | 93.3 | — | 0.62 | |
| llmStrategy=llm, Model=gpt-4o-mini2026.05 | 27.2 | 0.0002 | 78.2 | — | 0.006 |