Truthfulness on TruthfulQA (Metric: TruthfulQA)
59.2TruthfulQADPO + MaPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DPO + MaPPOBase Model=Qwen2.5-7B-Instruct2026.05 | 59.2 | |
| DPOBase Model=Qwen2.5-7B-Instruct2026.05 | 57.1 | |
| ITBase Model=Qwen2.5-7B-Instruct2026.05 | 56.4 | |
| I-DPO + MaPPOBase Model=Qwen2.5-7B-Instruct2026.05 | 56.2 | |
| I-DPOBase Model=Qwen2.5-7B-Instruct2026.05 | 55.9 | |
| O-LoRAModel=Qwen2.52026.04 | 42.9 | |
| Moderate-GiModel=Qwen32026.04 | 42.8 | |
| Moderate-GiModel=Qwen2.52026.04 | 42.5 | |
| O-LoRAModel=Qwen32026.04 | 42.3 | |
| CosineModel=1B, Pre-training Scheduler=Cosine, alpha_pre=0.1, alpha_mid=1.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 42 | |
| Moderate-GiModel=LLaMA-3.12026.04 | 41.5 | |
| CosineModel=1B, Pre-training Scheduler=Cosine, alpha_pre=0.1, alpha_mid=0.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 41.1 | |
| EWCModel=Qwen32026.04 | 40.5 | |
| WSDModel=1B, Pre-training Scheduler=WSD, alpha_pre=1.0, alpha_mid=0.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 40.4 | |
| RandomModel=Qwen32026.04 | 40.1 | |
| O-LoRAModel=LLaMA-3.12026.04 | 40 | |
| WSDModel=1B, Pre-training Scheduler=WSD, alpha_pre=0.1, alpha_mid=0.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 39.8 | |
| WSDModel=1B, Pre-training Scheduler=WSD, alpha_pre=0.1, alpha_mid=1.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 39.7 | |
| BaselineModel=Qwen32026.04 | 39.7 | |
| KLModel=Qwen32026.04 | 39.7 | |
| LinearModel=1B, Pre-training Scheduler=Linear, alpha_pre=0.1, alpha_mid=1.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 39.4 | |
| LinearModel=1B, Pre-training Scheduler=Linear, alpha_pre=0.1, alpha_mid=0.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 39 | |
| RandomModel=LLaMA-3.12026.04 | 38.6 | |
| KLModel=LLaMA-3.12026.04 | 38.6 | |
| RandomModel=Qwen2.52026.04 | 38.4 | |
| BaselineModel=Qwen2.52026.04 | 38.2 | |
| Grad. ClipModel=Qwen2.52026.04 | 38.2 | |
| Warmup-Stable-Only (WSO)Model=1B, Pre-training Scheduler=Warmup-Stable-Only (WSO), alpha_pre=1.0, alpha_mid=1.0, Pre-training tokens=2T, Mid-training tokens=500B, Training Stage=Supervised fine-tuned (SFT)2026.03 | 38.1 | |
| EWCModel=Qwen2.52026.04 | 38.1 | |
| EWCModel=LLaMA-3.12026.04 | 38 | |
| KLModel=Qwen2.52026.04 | 37.8 | |
| BaselineModel=LLaMA-3.12026.04 | 37.8 |