Generative multiple-choice on TruthfulQA (single)
78.1AccuracyTACS-S (Sentence-level)
Evaluation Results
| Method | Links | |
|---|---|---|
| TACS-S (Sentence-level)Backbone=Mistral-Instruct-v0.2, Model Size=7B, Granularity=Sentence-level, Information=single2024.03 | 78.1 | |
| TACS-T (Token-level)Backbone=Mistral-Instruct-v0.2, Model Size=7B, Granularity=Token-level, Information=single2024.03 | 77.1 | |
| TACS-T (Token-level)Backbone=Llama 2-Chat, Model Size=7B, Granularity=Token-level, Information=single2024.03 | 62.5 | |
| TACS-S (Sentence-level)Backbone=Llama 2-Chat, Model Size=7B, Granularity=Sentence-level, Information=single2024.03 | 60.6 | |
| Mistral-Instruct-v0.2Backbone=Mistral-Instruct-v0.2, Model Size=7B, Information=single2024.03 | 54.7 | |
| Llama 2-ChatBackbone=Llama 2-Chat, Model Size=7B, Information=single2024.03 | 49.1 |