Truthfulness Evaluation on TruthfulQA (Accuracy)
65.75AccuracyLoPT-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LoPT-GRPOBackbone=Qwen2.5-32B2026.05 | 65.75 | |
| E2E-GRPOBackbone=Qwen2.5-32B2026.05 | 65.73 | |
| BaseBackbone=Qwen2.5-32B2026.05 | 65.54 | |
| BaseModel=Qwen-2.5-7B-Inst, Evaluation Protocol=0-shot2026.04 | 62.51 | |
| POPModel=Qwen-2.5-7B-Inst, Evaluation Protocol=0-shot2026.04 | 62.35 | |
| Train on DModel=Qwen-2.5-7B-Inst, Evaluation Protocol=0-shot2026.04 | 56.4 | |
| PSO-MergingBase model=Qwen2.5-1.5B2026.05 | 52 | |
| CMABase model=Qwen2.5-1.5B2026.05 | 50 | |
| POPModel=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.04 | 49.81 | |
| Single BestBase model=Qwen2.5-1.5B2026.05 | 49.5 | |
| TIESBase model=Qwen2.5-1.5B2026.05 | 49.5 | |
| BaseModel=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.04 | 48.07 | |
| Train on DModel=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.04 | 48.06 | |
| Model SoupBase model=Qwen2.5-1.5B2026.05 | 46.5 | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 46.5 | |
| BaseBase model=Qwen2.5-1.5B2026.05 | 46 | |
| DAREBase model=Qwen2.5-1.5B2026.05 | 45.5 | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 45.5 | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 44 | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 36 |