Open-ended generation on TruthfulQA double info 1.0 (test)
68.4True ScoreTACS-T
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TACS-TBackbone=Mistral-Instruct-v0.2, Selection Strategy=Token-level Truth-Aware Context Selection2024.03 | 68.4 | 61.1 | |
| TACS-SBackbone=Mistral-Instruct-v0.2, Selection Strategy=Sentence-level Truth-Aware Context Selection2024.03 | 64.5 | 58.9 | |
| Mistral-Instruct-v0.2Backbone=Mistral-Instruct-v0.2, Selection Strategy=Baseline2024.03 | 62.1 | 57 | |
| TACS-TBackbone=Llama 2-Chat, Selection Strategy=Token-level Truth-Aware Context Selection2024.03 | 58.4 | 54.2 | |
| TACS-SBackbone=Llama 2-Chat, Selection Strategy=Sentence-level Truth-Aware Context Selection2024.03 | 58.4 | 53.5 | |
| Llama 2-ChatBackbone=Llama 2-Chat, Selection Strategy=Baseline2024.03 | 55.4 | 52.5 | |
| ITIBackbone=Llama 2-Chat, Selection Strategy=Inference-Time Intervention2024.03 | 52.9 | 50.2 |