Deductive Reasoning on LogicalDeduction
100AccuracyD&P
Evaluation Results
| Method | Links | |
|---|---|---|
| D&PParadigm=AF, Fallback Policy=Abstention (None), LLM=GPT-4o2026.03 | 100 | |
| D&PParadigm=AF, Fallback Policy=CoT, LLM=GPT-4o2026.03 | 100 | |
| D&PParadigm=AF, Fallback Policy=Abstention (None), LLM=GPT-42026.03 | 99.5 | |
| D&PParadigm=AF, Fallback Policy=CoT, LLM=GPT-42026.03 | 99.5 | |
| CLOVERParadigm=AF, Fallback Policy=CoT, LLM=GPT-4o2026.03 | 99.3 | |
| CLOVERParadigm=AF, Fallback Policy=Abstention (None), LLM=GPT-4o2026.03 | 99 | |
| MAD-LOGICParadigm=AF, Fallback Policy=Abstention (None), LLM=GPT-42026.03 | 94.33 | |
| SymbCoTParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-42026.03 | 93 | |
| CoTParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-4o2026.03 | 91.33 | |
| SymbCoTParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-4o2026.03 | 90.7 | |
| Logic-LMParadigm=AF, Fallback Policy=Abstention (None), LLM=GPT-42026.03 | 88 | |
| Logic-LMParadigm=AF, Fallback Policy=CoT, LLM=GPT-42026.03 | 87.63 | |
| DetermLRParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-42026.03 | 85 | |
| DirectParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-4o2026.03 | 84.7 | |
| CoTParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-42026.03 | 74.67 | |
| CoT-SCParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-42026.03 | 74.67 | |
| DirectParadigm=Prompting, Fallback Policy=N/A, LLM=GPT-42026.03 | 71.33 |