Logical Reasoning on Logical Reasoning Datasets Balanced
94.8RecolrOur Re-Cognizing Method
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Our Re-Cognizing MethodBackbone=Qwen2.5-7B2025.09 | 94.8 | 79.7 | 88.4 | 91.9 | 88.6 | |
| Our Re-Cognizing MethodBackbone=LLaMA3.1-8B2025.09 | 92.2 | 77.5 | 84 | 86.5 | 85.1 | |
| Optimization w/o Stage1Backbone=LLaMA3.1-8B2025.09 | 91.8 | 72.6 | 82.5 | 76.3 | 80.6 | |
| Optimization w/o Stage2Backbone=LLaMA3.1-8B2025.09 | 91.8 | 76.8 | 83.4 | 85.9 | 84.4 | |
| Bin-based Progressive LearningBackbone=Qwen2.5-7B2025.09 | 91.1 | 69.7 | 80.6 | 71.9 | 83.3 | |
| Curriculum LearningBackbone=LLaMA3.1-8B2025.09 | 90.8 | 68.4 | 77.3 | 86.4 | 81.5 | |
| DirectlyBackbone=LLaMA3.1-8B2025.09 | 90.1 | 77.4 | 80.2 | 81.2 | 81.6 | |
| Bin-based Progressive LearningBackbone=LLaMA3.1-8B2025.09 | 89.4 | 76.3 | 80.9 | 83.6 | 82.3 | |
| Curriculum LearningBackbone=Qwen2.5-7B2025.09 | 87.2 | 73.9 | 79.7 | 91.9 | 83.1 | |
| Optimization w/o Stage2Backbone=Qwen2.5-7B2025.09 | 83.9 | 68.4 | 77.8 | 87.2 | 79.3 | |
| Optimization w/o Stage1Backbone=Qwen2.5-7B2025.09 | 83.3 | 79 | 82.2 | 89.4 | 83.5 | |
| DirectlyBackbone=Qwen2.5-7B2025.09 | 79.7 | 71.9 | 78.8 | 88.8 | 79.8 | |
| GPT-4Model Category=Closed-source LLMs2025.09 | 79.4 | 58.8 | 65.1 | 76.5 | 69.9 | |
| DeepSeek-V3Model Category=Closed-source LLMs2025.09 | 73.8 | 50 | 66.3 | 84.7 | 68.6 | |
| BaseBackbone=LLaMA3.1-8B2025.09 | 44.7 | 41.2 | 38.3 | 71.4 | 49 | |
| BaseBackbone=Qwen2.5-7B2025.09 | 43.3 | 43.5 | 40.9 | 67.8 | 49 |