Commonsense Multi-hop Reasoning on StrategyQA 500 questions (test)
81.4AccuracyCyberCorrect
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CyberCorrectBackbone=GPT-42026.05 | 81.4 | 5.8 | |
| CyberCorrectBackbone=Claude-3.52026.05 | 80.2 | 6.4 | |
| CoVeBackbone=GPT-42026.05 | 78.2 | 10.1 | |
| Self-RefineBackbone=GPT-42026.05 | 77.4 | 12.3 | |
| No-CorrectionBackbone=GPT-42026.05 | 72.6 | — |