Generative Multiple-Choice on TruthfulQA (double)
79.3AccuracyTACS-T (Token-level)
Evaluation Results
| Method | Links | |
|---|---|---|
| TACS-T (Token-level)Backbone=Mistral-Instruct-v0.2, Model Size=7B, Granularity=Token-level, Information=double2024.03 | 79.3 | |
| TACS-S (Sentence-level)Backbone=Mistral-Instruct-v0.2, Model Size=7B, Granularity=Sentence-level, Information=double2024.03 | 77.5 | |
| Mistral-Instruct-v0.2Backbone=Mistral-Instruct-v0.2, Model Size=7B, Information=double2024.03 | 69.9 | |
| TACS-T (Token-level)Backbone=Llama 2-Chat, Model Size=7B, Granularity=Token-level, Information=double2024.03 | 59.4 | |
| TACS-S (Sentence-level)Backbone=Llama 2-Chat, Model Size=7B, Granularity=Sentence-level, Information=double2024.03 | 56.2 | |
| Llama 2-ChatBackbone=Llama 2-Chat, Model Size=7B, Information=double2024.03 | 53.7 |