Commonsense Reasoning on StrategyQA (Accuracy, Improvement)
76.84AccuracyRICP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 76.84 | 3.06 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 75.92 | 0.61 | |
| Few-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 75.31 | — | |
| Few-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 73.78 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Auto CoT2024.07 | 73.67 | 1.02 | |
| Auto CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 72.65 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 72.45 | 1.53 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Auto CoT2024.07 | 72.04 | 0.61 | |
| Auto CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 71.43 | — | |
| Zero-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 70.92 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Complex CoT2024.07 | 70.31 | 1.12 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Complex CoT2024.07 | 69.8 | 1.22 | |
| Complex CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 69.18 | — | |
| Complex CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 68.57 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Standard Prompting2024.07 | 67.55 | 0.61 | |
| Zero-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 67.35 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 67.24 | -0.11 | |
| Standard PromptingBackbone=Qwen-Turbo, Enhancement=None2024.07 | 66.94 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Standard Prompting2024.07 | 66.33 | 2.55 | |
| Standard PromptingBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 63.78 | — |