Causal Reasoning on Corr2Cause
97.5AccuracyLLaMA-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaMA-7BEvaluation Protocol=finetuned2026.05 | 97.5 | 92 | |
| A-CBO (GLM-5.1)Tier=HIGH, Framework=A-CBO2026.05 | 95.3 | 93.2 | |
| A-CBO (Qwen3-30B)Tier=HIGH, Framework=A-CBO2026.05 | 94.6 | 92.1 | |
| A-CBO (Qwen3.5-122B)Tier=MID, Framework=A-CBO2026.05 | 89.8 | 87.1 | |
| A-CBO (Llama-3.3-70B)Tier=MID, Framework=A-CBO2026.05 | 88.1 | 85.7 | |
| A-CBO (Gemma-3-12B)Tier=LOW, Framework=A-CBO2026.05 | 81.4 | 77.6 | |
| A-CBO (LLaMA-7B)Tier=LOW, Framework=A-CBO2026.05 | 76.2 | 72.6 | |
| GPT-4Evaluation Protocol=zero-shot2026.05 | 64.6 | 29.1 | |
| UNICOBase Model=Qwen3-4B, Data=UNICO2026.05 | 47.7 | — | |
| UNICOBase Model=Qwen3-8B, Data=UNICO2026.05 | 42.5 | — | |
| CDCRBase Model=Qwen3-8B, Data=CDCR2026.05 | 40.1 | — | |
| CauGymBase Model=Qwen3-4B, Data=CauGym2026.05 | 39.4 | — | |
| CauGymBase Model=Qwen3-8B, Data=CauGym2026.05 | 38.1 | — | |
| UNICOBase Model=Olmo3-7B-Instruct, Data=UNICO2026.05 | 35.4 | — | |
| Qwen3-32BBase Model=Qwen3-32B2026.05 | 34.5 | — | |
| Olmo3.1-32B-InstructBase Model=Olmo3.1-32B-Instruct2026.05 | 33.3 | — | |
| OriginalBase Model=Qwen3-8B, Data=Original2026.05 | 33 | — | |
| OriginalBase Model=Qwen3-4B, Data=Original2026.05 | 32.3 | — | |
| CDCRBase Model=Qwen3-4B, Data=CDCR2026.05 | 31.8 | — | |
| CauGymBase Model=Olmo3-7B-Instruct, Data=CauGym2026.05 | 30.2 | — | |
| CDCRBase Model=Olmo3-7B-Instruct, Data=CDCR2026.05 | 24.2 | — | |
| OriginalBase Model=Olmo3-7B-Instruct, Data=Original2026.05 | 22.4 | — |