Commonsense and Logical Reasoning on CSQA, StrategyQA, LogiQA
64.95AccuracyRICP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 64.95 | 1.81 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 63.74 | 2.3 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Auto CoT2024.07 | 63.68 | 1.02 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Complex CoT2024.07 | 63.68 | 2.73 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 63.6 | 2.48 | |
| Few-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 63.14 | — | |
| Auto CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 62.66 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Auto CoT2024.07 | 61.78 | 2.01 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Complex CoT2024.07 | 61.57 | 2.92 | |
| Zero-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 61.44 | — | |
| Few-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 61.13 | — | |
| Complex CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 60.95 | — | |
| Auto CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 59.76 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 59.62 | 4.29 | |
| Complex CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 58.65 | — | |
| Zero-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 55.34 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Standard Prompting2024.07 | 48.92 | 2.97 | |
| Standard PromptingBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 45.95 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Standard Prompting2024.07 | 45.81 | 1.6 | |
| Standard PromptingBackbone=Qwen-Turbo, Enhancement=None2024.07 | 44.21 | — |