Scientific Fact Verification on SciFact
83.03Macro F1KG-CRAFTL3.3
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| KG-CRAFTL3.3Backbone=L3.32026.01 | 83.03 | 84.58 | 81.53 | 0.8152 | — | |
| KG-CRAFTC3.5Backbone=C3.52026.01 | 75.83 | 76.5 | 75.18 | 0.7517 | — | |
| GraphFC2026.01 | 0.8737 | — | — | — | — | |
| KG-CRAFTModel variant=L3.32026.01 | 0.8303 | 0.8458 | 0.8153 | — | — | |
| LAGMiDBackbone=Qwen3-8B2026.03 | 0.8205 | 0.7724 | — | — | 0.8208 | |
| AnomalyLLMCategory=Text-Rich Graph Learning2026.03 | 0.7958 | 0.7485 | — | — | 0.8024 | |
| GuARDCategory=Text-Rich Graph Learning2026.03 | 0.7714 | 0.7453 | — | — | 0.7906 | |
| KG-CRAFTModel variant=C3.52026.01 | 0.7583 | 0.765 | 0.7518 | — | — | |
| PACAR2026.01 | 0.7506 | — | — | — | — | |
| MULTIVERSEvidence Settings=full and abstract-level2026.01 | 0.725 | 0.738 | 0.712 | — | — | |
| GLMBackbone=GLM4-9B2026.03 | 0.7242 | 0.725 | — | — | 0.7909 | |
| QwenBackbone=Qwen3-8B2026.03 | 0.7213 | 0.7536 | — | — | 0.7832 | |
| ProgramFC2026.01 | 0.7182 | — | — | — | — | |
| MERMAIDLLM=GPT-4o2026.01 | 0.7 | — | — | — | — | |
| FOLK2026.01 | 0.68 | — | — | — | — | |
| MERMAIDLLM=GPT-5 Mini2026.01 | 0.68 | — | — | — | — | |
| SciBERTCategory=PLM-based2026.03 | 0.6622 | 0.7102 | — | — | 0.6211 | |
| MERMAIDLLM=Qwen-2.5-70B2026.01 | 0.66 | — | — | — | — | |
| MERMAIDLLM=OSS-120B2026.01 | 0.65 | — | — | — | — | |
| CO-GATBackbone=ELECTRA, Model Scale=Large, Evidence Settings=abstract-level2026.01 | 0.6439 | 0.7958 | 0.5407 | — | — | |
| MLABackbone=RoBERTa2026.01 | 0.6154 | 0.8062 | 0.4976 | — | — | |
| Self-Ask2026.01 | 0.61 | — | — | — | — | |
| GLADCategory=GNN-based2026.03 | 0.6006 | 0.6677 | — | — | 0.6244 | |
| RoBERTaCategory=PLM-based2026.03 | 0.5252 | 0.636 | — | — | 0.5677 | |
| GCNCategory=GNN-based2026.03 | 0.5138 | 0.6673 | — | — | 0.6045 | |
| GraphCheckL3.3Backbone=L3.32026.01 | — | — | — | 0.894 | — | |
| GraphCheckQwen 72BBackbone=Qwen 72B2026.01 | — | — | — | 0.864 | — | |
| MiniCheck-7BModel Size=7B2026.04 | — | — | — | 0.5 | — | |
| ThinknCheck-1BModel Size=1B2026.04 | — | — | — | 0.647 | — | |
| ThinknCheck-nothink-1BModel Size=1B, Reasoning=None2026.04 | — | — | — | 0.217 | — | |
| ThinknCheck-Science-1BModel Size=1B, Training Data=Scientific and arithmetic2026.04 | — | — | — | 0.664 | — | |
| VERDI LRModel=GPT-4.1-mini2026.05 | — | — | — | — | 0.91 | |
| VERDI LRModel=GPT-5.4-mini2026.05 | — | — | — | — | 0.798 |