Logical Reasoning on LogiQA2
86.4AccuracyGPT-4.5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4.52026.06 | 86.4 | — | |
| GPT-4.52026.06 | 83.1 | — | |
| IGA (Ours)2026.06 | 79.2 | — | |
| IGA (Ours)2026.06 | 74.8 | — | |
| Pareto-GS2026.06 | 74.1 | — | |
| SAND-Mask2026.06 | 73.6 | — | |
| PCGrad2026.06 | 72.9 | — | |
| V-REx2026.06 | 72.4 | — | |
| IRM2026.06 | 71.8 | — | |
| ERM-SFT2026.06 | 70.1 | — | |
| Pareto-GS2026.06 | 69.3 | — | |
| CoT-Distill2026.06 | 69.2 | — | |
| LoRA-SFT2026.06 | 68.4 | — | |
| SAND-Mask2026.06 | 66.8 | — | |
| PCGrad2026.06 | 65.7 | — | |
| V-REx2026.06 | 64.9 | — | |
| IRM2026.06 | 64.3 | — | |
| ERM-SFT2026.06 | 61.2 | — | |
| CoT-Distill2026.06 | 61 | — | |
| LoRA-SFT2026.06 | 60.1 | — | |
| Teacher (Qwen3-4B)Precision=BF162026.06 | 34.4 | — | |
| Recover-LoRA (OpenHermes-10k)Recovery Training Dataset=OpenHermes-10k, Quantization=W2-GateUp2026.06 | 32.9 | 84.9 | |
| Recover-LoRA (Synthetic-10k)Recovery Training Dataset=Synthetic-10k, Quantization=W2-GateUp2026.06 | 30.5 | 60.5 | |
| Quantized Student (Qwen3-4B)Quantization=W2-GateUp (gate/up at INT2, remaining at BF16)2026.06 | 24.7 | — |