Question Answering on TruthfulQA (Accuracy and Utility)
68.2AccuracyMistral-v2-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Mistral-v2-7BBackbone=Mistral-v2-7B2026.05 | 68.2 | 56.4 | |
| Circuit-Breaker (CB)Backbone=Mistral-v2-7B2026.05 | 66.9 | -26 | |
| AlphaSteerBackbone=Mistral-v2-7B2026.05 | 66.6 | 31.4 | |
| bi-level adversarial training framework (Ours)Backbone=Mistral-v2-7B2026.05 | 66.6 | 36.6 | |
| Latent Adversarial Training (LAT)Backbone=Mistral-v2-7B2026.05 | 66.5 | 24.5 | |
| ROSIBackbone=Mistral-v2-7B2026.05 | 65.9 | 20.7 | |
| Qwen-2.5-7BBackbone=Qwen-2.5-7B2026.05 | 62.4 | 74.8 | |
| bi-level adversarial training framework (Ours)Backbone=Qwen-2.5-7B2026.05 | 60 | 53.5 | |
| Latent Adversarial Training (LAT)Backbone=Qwen-2.5-7B2026.05 | 59.7 | 46.8 | |
| AlphaSteerBackbone=Qwen-2.5-7B2026.05 | 59.5 | 49.8 | |
| Circuit-Breaker (CB)Backbone=Qwen-2.5-7B2026.05 | 59.2 | 40.3 | |
| ROSIBackbone=Qwen-2.5-7B2026.05 | 57.3 | 42.2 | |
| LLaMA-3-8BBackbone=LLaMA-3-8B2026.05 | 51.6 | 56.5 | |
| Circuit-Breaker (CB)Backbone=LLaMA-3-8B2026.05 | 51.3 | 14 | |
| bi-level adversarial training framework (Ours)Backbone=LLaMA-3-8B2026.05 | 51.2 | 46.5 | |
| Latent Adversarial Training (LAT)Backbone=LLaMA-3-8B2026.05 | 51 | 23.5 | |
| AlphaSteerBackbone=LLaMA-3-8B2026.05 | 51 | 37.9 | |
| ROSIBackbone=LLaMA-3-8B2026.05 | 50.4 | 30.1 |