Multi-Classification on LIAR Open
46.81AccuracyFew-shot
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Few-shotLLM=GPT-3.5-turbo2024.02 | 46.81 | 44.61 | |
| Few-shot COTLLM=GPT-3.5-turbo2024.02 | 45.63 | 36.36 | |
| Zero-shot COTLLM=GPT-3.5-turbo2024.02 | 39.81 | 36.49 | |
| w/ InterventionLLM=Llama2 (13B)2024.02 | 38.63 | 30.6 | |
| TELLERLLM=Llama2 (13B)2024.02 | 38.08 | 29.27 | |
| w/ InterventionLLM=FLAN-T5-xxl (11B)2024.02 | 35.88 | 31.63 | |
| TELLERLLM=FLAN-T5-xxl (11B)2024.02 | 35.48 | 30.42 | |
| w/ InterventionLLM=FLAN-T5-large (780M)2024.02 | 35.25 | 30.05 | |
| w/ InterventionLLM=FLAN-T5-xl (3B)2024.02 | 34.46 | 33.59 | |
| w/ InterventionLLM=Llama2 (7B)2024.02 | 34.3 | 27.58 | |
| TELLERLLM=FLAN-T5-large (780M)2024.02 | 33.67 | 27.5 | |
| TELLERLLM=FLAN-T5-xl (3B)2024.02 | 33.52 | 27.22 | |
| TELLERLLM=Llama2 (7B)2024.02 | 32.73 | 25.55 | |
| DirectLLM=FLAN-T5-xxl (11B)2024.02 | 32.18 | 28.12 | |
| TELLERLLM=GPT-3.5-turbo2024.02 | 31.94 | 29.53 | |
| DirectLLM=FLAN-T5-large (780M)2024.02 | 29.5 | 24.95 | |
| DirectLLM=FLAN-T5-xl (3B)2024.02 | 29.43 | 24.74 | |
| DirectLLM=GPT-3.5-turbo2024.02 | 26.2 | 25.12 | |
| DirectLLM=FLAN-T5-base (250M)2024.02 | 21.4 | 21.4 | |
| Few-shot LogicLLM=GPT-3.5-turbo2024.02 | 20.54 | 19.22 | |
| DirectLLM=FLAN-T5-small (80M)2024.02 | 19.51 | 10.13 | |
| DirectLLM=Llama2 (7B)2024.02 | 11.01 | 6.88 | |
| DirectLLM=Llama2 (13B)2024.02 | 10.86 | 8.25 |