Fact Verification on LIAR
68.6F1 ScoreERM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ERMTask Model=Doubao-Pro, Optimizer Model=GPT-4o2026.02 | 68.6 | — | — | — | |
| SPOTask Model=GPT-4o-mini, Optimizer Model=GPT-4o2026.02 | 66.9 | — | — | — | |
| C-MOP (Ours)Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 64.46 | — | — | 82.08 | |
| BiMindArchitecture=BiMind2026.04 | 63.3 | 63.7 | 63.6 | 63.3 | |
| PromptWizard*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 61.61 | — | — | 80.5 | |
| SPO*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 59.38 | — | — | 78.84 | |
| ProTeGi*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 58.47 | — | — | 78.72 | |
| GPO*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 57.85 | — | — | 78.5 | |
| HeteroSGTArchitecture=HeteroSGT2026.04 | 57.1 | 58 | 57.5 | 58.1 | |
| BERTArchitecture=BERT2026.04 | 48.3 | 51.3 | 51 | 53.7 | |
| HANArchitecture=HAN2026.04 | 44.5 | 49.3 | 50.2 | 54.6 | |
| GCNArchitecture=GCN2026.04 | 42.3 | 49.3 | 49.4 | 48.7 | |
| RAFTSbackbone=GPT-3.52024.06 | 42 | 47.1 | 37.9 | — | |
| Zero-shot (Base)Task Model=Q30BA3B-Inst2026.02 | 40.92 | — | — | 67.75 | |
| RAFTSbackbone=Mistral 7B2024.06 | 40.8 | 61.6 | 30.5 | — | |
| CNNArchitecture=CNN2026.04 | 37.7 | 43.2 | 50.2 | 54.6 | |
| HiSS2024.06 | 37.5 | 46.8 | 31.3 | — | |
| ReAct2024.06 | 31 | 33.2 | 29 | — | |
| CofCED2024.06 | 29.5 | 29.5 | 29.6 | — | |
| GPT 3.52024.06 | 27 | 29.1 | 25.1 | — | |
| CoT2024.06 | 23.7 | 22.6 | 24.2 | — | |
| SBERT-FC2024.06 | 23.1 | 24.1 | 22.1 | — | |
| SentHAN2024.06 | 21.2 | 22.6 | 20 | — | |
| dEFEND2024.06 | 20.5 | 23 | 18.5 | — |