Causal Discovery on Alarm (d=37, |E|=46) medium-scale (test)
100PrecisionFCI (Baseline)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FCI (Baseline)Base Algorithm=FCI2026.01 | 100 | 34.8 | 51.6 | 30 | — | |
| CauScientist (Qwen3-32B)Base Algorithm=AVICI, LLM Backbone=Qwen3-32B2026.01 | 96.7 | 63 | 76.3 | 17.8 | — | |
| CauScientist (Qwen3-14B)Base Algorithm=AVICI, LLM Backbone=Qwen3-14B2026.01 | 96.5 | 59.6 | 73.6 | 18.6 | — | |
| AVICI (Baseline)Base Algorithm=AVICI2026.01 | 95.2 | 58.7 | 72.5 | 19.4 | — | |
| CauScientist (Qwen3-14B)Base Algorithm=FCI, LLM Backbone=Qwen3-14B2026.01 | 84.8 | 47.4 | 60.6 | 27.4 | — | |
| Tabu-ALSample size=1000, Data=Clean2026.01 | 80 | 64 | 71 | — | 63 | |
| Expert Model AvgSample size=1000, Data=Noisy2026.01 | 78 | 52 | 63 | — | 51 | |
| CauScientist (Qwen3-32B)Base Algorithm=FCI, LLM Backbone=Qwen3-32B2026.01 | 76.7 | 45.7 | 56.7 | 31.2 | — | |
| Tabu-ALSample size=1000, Data=Noisy2026.01 | 75 | 35 | 48 | — | 35 | |
| Expert Model AvgSample size=10000, Data=Noisy2026.01 | 69 | 68 | 68 | — | 64 | |
| Tabu-ALSample size=10000, Data=Clean2026.01 | 68 | 72 | 70 | — | 69 | |
| Expert Model AvgSample size=10000, Data=Clean2026.01 | 67 | 85 | 75 | — | 82 | |
| Tabu-ALSample size=10000, Data=Noisy2026.01 | 64 | 58 | 61 | — | 55 | |
| Expert Model AvgSample size=1000, Data=Clean2026.01 | 63 | 80 | 70 | — | 77 | |
| Bayesys Model AvgSample size=1000, Data=Noisy2026.01 | 60 | 50 | 54 | — | 47 | |
| Bayesys Model AvgSample size=10000, Data=Noisy2026.01 | 51 | 65 | 57 | — | 59 | |
| Bayesys Model AvgSample size=10000, Data=Clean2026.01 | 43 | 89 | 58 | — | 80 | |
| Qwen3-14BEvaluation Protocol=Zero-shot, Base Algorithm=Pure LLM2026.01 | 38.5 | 35.2 | 36.4 | 54.2 | — | |
| Bayesys Model AvgSample size=1000, Data=Clean2026.01 | 36 | 80 | 50 | — | 70 | |
| Qwen3-32BEvaluation Protocol=Zero-shot, Base Algorithm=Pure LLM2026.01 | 33 | 35.2 | 33.9 | 61.8 | — |