Truthful and Informative Generation on TruthfulQA (test)
84.7True*Info (%)A-LQR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| A-LQRBackbone=Qwen2.5-32B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 84.7 | 86.78 | 97.6 | |
| S-PIDBackbone=Qwen2.5-32B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 78.52 | 80.51 | 97.53 | |
| A-LQRBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 76.28 | 80.81 | 94.39 | |
| ODESteerBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 71.56 | 75.03 | 95.37 | |
| A-LQRBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 67.81 | 73.17 | 92.68 | |
| Llama3-8B-chat + E/R + CoarseBackbone=Llama3-8B-chat, Evaluator=FENCE, Recipe=Edit/Remove + Coarse2024.10 | 67.14 | — | — | |
| Llama3-8B-chat + FactTune-FSBackbone=Llama3-8B-chat, Recipe=FactTune-FS2024.10 | 64.58 | — | — | |
| A-LQRBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 63.63 | 65.8 | 96.7 | |
| ODESteerBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 63.5 | 66.24 | 95.86 | |
| Llama3-8B-chat + EVER-PrefBackbone=Llama3-8B-chat, Recipe=EVER-Pref2024.10 | 63.01 | — | — | |
| S-PIDBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 62.99 | 64.99 | 96.92 | |
| ODESteerBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 62.36 | 64.11 | 97.26 | |
| Llama3-8B-chat + Self-Eval-SKTBackbone=Llama3-8B-chat, Recipe=Self-Eval-SKT2024.10 | 61.88 | — | — | |
| S-PIDBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 61.48 | 63.55 | 96.74 | |
| Llama3-8B-chat + SFTBackbone=Llama3-8B-chat, Recipe=SFT2024.10 | 59.17 | — | — | |
| ActAddBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 59.14 | 65.26 | 90.76 | |
| ActAddBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 58.98 | 67.94 | 86.8 | |
| Llama3-8B-chatBackbone=Llama3-8B-chat2024.10 | 58.89 | — | — | |
| S-PIDBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 58.26 | 62.06 | 93.88 | |
| PID-AcTBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 58.07 | 62.96 | 92.26 | |
| PID-AcTBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 58.07 | 62.96 | 92.26 | |
| ITIBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 57.01 | 59.09 | 96.47 | |
| Llama2-7B-chat + E/R + CoarseBackbone=Llama2-7B-chat, Evaluator=FENCE, Recipe=Edit/Remove + Coarse2024.10 | 56.47 | — | — | |
| Linear-AcTBackbone=Qwen2.5-32B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 55.94 | 57.6 | 97.14 | |
| ActAddBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 55.85 | 62.04 | 90.28 | |
| Mean-AcTBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 55.81 | 55.32 | 97.1 | |
| OriginalBackbone=Qwen2.5-32B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 55.29 | 57.02 | 96.96 | |
| Linear-AcTBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 53.71 | 55.32 | 97.1 | |
| PID-AcTBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 53.3 | 54.92 | 97.06 | |
| ITIBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 53.24 | 59.07 | 90.13 | |
| ITIBackbone=Qwen2.5-32B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 53.24 | 55.91 | 95.23 | |
| OriginalBackbone=Qwen-2.5-14B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 53.17 | 55.15 | 96.4 | |
| Llama2-7B-chat + FactTune-FSBackbone=Llama2-7B-chat, Recipe=FactTune-FS2024.10 | 52.48 | — | — | |
| Llama2-7B-chat + EVER-PrefBackbone=Llama2-7B-chat, Recipe=EVER-Pref2024.10 | 51.07 | — | — | |
| Mean-AcTBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 50.12 | 53.85 | 93.06 | |
| Linear-AcTBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 50.07 | 53.1 | 94.29 | |
| Linear-AcTBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 50.07 | 53.1 | 94.29 | |
| Llama2-7B-chat + Self-Eval-SKTBackbone=Llama2-7B-chat, Recipe=Self-Eval-SKT2024.10 | 48.65 | — | — | |
| OriginalBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 48.64 | 50.62 | 96.08 | |
| ITIBackbone=Gemma-2-2B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 47.54 | 50.18 | 94.74 | |
| Mean-AcTBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 47.02 | 48.22 | 97.52 | |
| OriginalBackbone=Llama-3-8B, Evaluation Protocol=finetuned LLM-as-a-judge2026.04 | 46.22 | 47.44 | 97.43 | |
| Llama2-7B-chat + SFTBackbone=Llama2-7B-chat, Recipe=SFT2024.10 | 45.52 | — | — | |
| Llama2-7B-chatBackbone=Llama2-7B-chat2024.10 | 38.83 | — | — |