Logical Reasoning on Logical Reasoning Datasets Unbalanced
94.4RecolrOur Re-Cognizing Method
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Our Re-Cognizing MethodBackbone=Qwen2.5-7B2025.09 | 94.4 | 82.4 | 84.5 | 85.8 | 85.8 | |
| Bin-based Progressive LearningBackbone=LLaMA3.1-8B2025.09 | 93 | 74.2 | 82.1 | 83.1 | 82.6 | |
| Our Re-Cognizing MethodBackbone=LLaMA3.1-8B2025.09 | 93 | 75 | 83.5 | 85.7 | 84.3 | |
| Curriculum LearningBackbone=LLaMA3.1-8B2025.09 | 92.6 | 63.4 | 79.8 | 85.4 | 81.1 | |
| Optimization w/o Stage2Backbone=LLaMA3.1-8B2025.09 | 91 | 71.7 | 79.6 | 82.4 | 80.9 | |
| Optimization w/o Stage1Backbone=LLaMA3.1-8B2025.09 | 90.4 | 69.9 | 79.1 | 74.7 | 77.1 | |
| DirectlyBackbone=LLaMA3.1-8B2025.09 | 89.6 | 72.4 | 80.5 | 81.2 | 80.6 | |
| Bin-based Progressive LearningBackbone=Qwen2.5-7B2025.09 | 89 | 73 | 78.2 | 84.2 | 81.2 | |
| Curriculum LearningBackbone=Qwen2.5-7B2025.09 | 86.4 | 75 | 80.6 | 85 | 82.3 | |
| Optimization w/o Stage1Backbone=Qwen2.5-7B2025.09 | 85.6 | 80.8 | 81.7 | 83.3 | 82.7 | |
| GPT-4Model Category=Closed-source LLMs2025.09 | 80.8 | 52.5 | 66.4 | 77.4 | 70.7 | |
| Optimization w/o Stage2Backbone=Qwen2.5-7B2025.09 | 79.8 | 67.9 | 76.7 | 82.7 | 78.4 | |
| DirectlyBackbone=Qwen2.5-7B2025.09 | 78.6 | 74.3 | 74.8 | 81 | 77.8 | |
| DeepSeek-V3Model Category=Closed-source LLMs2025.09 | 75.4 | 48.4 | 66.3 | 81.4 | 71.2 | |
| BaseBackbone=Qwen2.5-7B2025.09 | 46.6 | 37.2 | 42.4 | 62.9 | 50.9 | |
| BaseBackbone=LLaMA3.1-8B2025.09 | 44.4 | 34.7 | 37.8 | 70.7 | 52.1 |