Truthfulness Evaluation on TruthfulQA generation
7.9Exclusive Catch Rate (@10%)QWEN 2.5 7B-I
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QWEN 2.5 7B-IProbe training=WikiText, Decoding=Greedy, Prompt=Minimal task prompt, Task-specific training=None2026.04 | 7.9 | 12.7 | |
| Phi-3 Mini-IProbe training=WikiText, Decoding=Greedy, Prompt=Minimal task prompt, Task-specific training=None2026.04 | 7.7 | 13.1 | |
| Mistral 7B-IProbe training=WikiText, Decoding=Greedy, Prompt=Minimal task prompt, Task-specific training=None2026.04 | 6.7 | 10.9 |