Veracity Prediction on LIAR RAW
50.59Macro F1S-EGS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| S-EGSx -> y=c → v; exp, Model (Backbone)=LLaMA2-7B, No Closed-Source API Dependency=true, # Distill Explanations for RAW-FC=4652025.11 | 50.59 | 52.45 | 50.39 | |
| SFTx -> y=c → v; exp, Model (Backbone)=LLaMA2-7B, No Closed-Source API Dependency=true, # Distill Explanations for RAW-FC=02025.11 | 43.05 | 48.38 | 46.83 | |
| RAFTSReproduced=false2025.05 | 42 | 47 | 37 | |
| HiSS (Google)x -> y=c → v; exp, Model (Backbone)=ChatGPT, No Closed-Source API Dependency=false, utilizing search API=Google2025.11 | 37.5 | 46.8 | 31.3 | |
| HiSSReproduced=false2025.05 | 37 | 46 | 31 | |
| G-DefenseLLaMA3.1Approach category=Ours2026.04 | 32.49 | 34.17 | 32.37 | |
| G-DefenseApproach category=Ours2026.04 | 31.55 | 33.09 | 31.55 | |
| L-DenfenseLLaMA2Approach category=LLM-based approach2026.04 | 31.4 | 31.63 | 31.71 | |
| L-Defense (Llama2)Backbone=Llama2, Reproduced=false2025.05 | 31 | 31 | 31 | |
| G-DefensebackgroundApproach category=Ours2026.04 | 30.89 | 31.5 | 31.28 | |
| L-DenfenseGPT-3.5Approach category=LLM-based approach2026.04 | 30.53 | 30.55 | 32.2 | |
| L-Denfensex -> y=c; evi → v; exp, Model (Backbone)=ChatGPT + Roberta-Large, No Closed-Source API Dependency=false, # Distill Explanations for RAW-FC=32,2402025.11 | 30.53 | 30.55 | 32.2 | |
| FactLLaMAknowApproach category=LLM-based approach2026.04 | 30.44 | 32.46 | 32.05 | |
| FactLLaMA (Google)x -> y=c; evi → v, Model (Backbone)=LLaMA2-7B, No Closed-Source API Dependency=false, utilizing search API=Google2025.11 | 30.44 | 32.46 | 32.05 | |
| G-Defensedecomp+Approach category=Ours2026.04 | 30.36 | 32.03 | 30.23 | |
| FactLLaMAReproduced=false2025.05 | 30 | 32 | 32 | |
| L-Defense (ChatGPT)Backbone=ChatGPT, Reproduced=false2025.05 | 30 | 30 | 32 | |
| FactLLaMAApproach category=LLM-based approach2026.04 | 29.98 | 32.32 | 31.57 | |
| G-DefensehyperApproach category=Ours2026.04 | 29.75 | 31.21 | 29.53 | |
| L-Defense (Reproduced)Reproduced=true2025.05 | 29 | 29 | 29 | |
| CofCEDApproach category=Traditional approach2026.04 | 28.93 | 29.48 | 29.55 | |
| MUSERApproach category=Traditional approach2026.04 | 26.52 | 27.8 | 26.58 | |
| GenFEApproach category=Traditional approach2026.04 | 26.49 | 28.01 | 26.16 | |
| RAVx -> y=c; evi → v; exp, Model (Backbone)=LLaMA-3.1-70B-Instruct x3, No Closed-Source API Dependency=true2025.11 | 25.4 | — | — | |
| GPT-3.5claimApproach category=LLM-based approach2026.04 | 25.11 | 25.41 | 27.33 | |
| ChatGPTx -> y=c → v; exp, No Closed-Source API Dependency=false2025.11 | 25.11 | 25.41 | 27.33 | |
| SBERT-FCApproach category=Traditional approach2026.04 | 22.19 | 24.09 | 22.07 | |
| GPT-3.5fullApproach category=LLM-based approach2026.04 | 21.9 | 29.64 | 23.57 | |
| ChatGPTx -> y=c, evi → v; exp, No Closed-Source API Dependency=false2025.11 | 21.9 | 29.64 | 23.57 | |
| dEFENDApproach category=Traditional approach2026.04 | 17.51 | 23.09 | 18.56 | |
| GenFE-MTApproach category=Traditional approach2026.04 | 15.15 | 18.55 | 19.9 | |
| LLaMA2claimApproach category=LLM-based approach2026.04 | 15.14 | 17.11 | 17.37 |