Commonsense Reasoning on CSQA (Accuracy and Improvement)
88.1AccuracyRICP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 88.1 | 1 | |
| Zero-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 87.1 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 83.7 | 1.1 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Standard Prompting2024.07 | 83.5 | 0.7 | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Complex CoT2024.07 | 83.4 | 2.2 | |
| Standard PromptingBackbone=Qwen-Turbo, Enhancement=None2024.07 | 82.8 | — | |
| Few-shot CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 82.6 | — | |
| Complex CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 81.2 | — | |
| Auto CoTBackbone=Qwen-Turbo, Enhancement=None2024.07 | 80.9 | — | |
| RICPBackbone=Qwen-Turbo, Prompting Strategy=Auto CoT2024.07 | 80.7 | -0.2 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Zero-shot CoT2024.07 | 79.9 | 4.3 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Complex CoT2024.07 | 79.3 | 2.6 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Auto CoT2024.07 | 78.8 | 2.9 | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Few-shot CoT2024.07 | 78.2 | 1.3 | |
| Few-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 76.9 | — | |
| Complex CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 76.7 | — | |
| RICPBackbone=GPT-3.5-Turbo, Prompting Strategy=Standard Prompting2024.07 | 76 | 4 | |
| Auto CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 75.9 | — | |
| Zero-shot CoTBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 75.6 | — | |
| Standard PromptingBackbone=GPT-3.5-Turbo, Enhancement=None2024.07 | 72 | — |