Multi-hop Question Answering on HotpotQA Overall distractor (val)
47.3Mean F1zebra-additive
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| zebra-additiveStrategy=zebra-additive, Model=gpt-4o-mini, alpha=0.5, runs_per_cell=152026.05 | 47.3 | 0.0003 | 92.1 | 1 | 0.65 | |
| uniformStrategy=uniform, Model=gpt-4o-mini, alpha=0.5, runs_per_cell=152026.05 | 46.9 | 0.0003 | 91.3 | 0.0004 | — | |
| zebra-mult_offsetStrategy=zebra-mult_offset, Model=gpt-4o-mini, alpha=0.5, runs_per_cell=152026.05 | 46.3 | 0.0003 | 90 | 0.0007 | 0.51 | |
| llmStrategy=llm, Model=gpt-4o-mini, alpha=0.5, runs_per_cell=152026.05 | 40 | 0.0002 | 77.8 | — | 0.0004 |