Commonsense Reasoning on TruthfulQA
71.48AccuracySPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SPPO2025.09 | 71.48 | |
| HT-MNPOReward Model=Athene-RM-8B2025.09 | 71.36 | |
| DPO2025.09 | 71.24 | |
| INPO2025.09 | 71.24 | |
| HT-MNPOReward Model=Skywork-Reward-V22025.09 | 70.87 | |
| SFT Model2025.09 | 70.75 | |
| HT-MNPOReward Model=ArmoRM-Llama32025.09 | 70.38 | |
| TD-MNPO2025.09 | 70.26 | |
| SimPO2025.09 | 63.4 | |
| FP16Backbone=Qwen2.5-7B2026.03 | 39.05 | |
| NSDSBackbone=Qwen2.5-7B2026.03 | 31.15 | |
| ZDBackbone=Qwen2.5-7B2026.03 | 28.94 | |
| FP16Backbone=Llama-3.1-8B2026.03 | 28.4 | |
| KurtBoostBackbone=Qwen2.5-7B2026.03 | 28.35 | |
| MSEBackbone=Qwen2.5-7B2026.03 | 27.82 | |
| EWQBackbone=Qwen2.5-7B2026.03 | 26.95 | |
| NSDSBackbone=Llama-3.1-8B2026.03 | 26.43 | |
| MDM-Prime-v2Zero-shot=true, Number of Parameters=1.1B2026.03 | 25.83 | |
| BloomZero-shot=true, Number of Parameters=1.1B2026.03 | 25.58 | |
| KurtBoostBackbone=Llama-3.1-8B2026.03 | 25.15 | |
| SMDMZero-shot=true, Number of Parameters=1.1B2026.03 | 24.6 | |
| ZDBackbone=Llama-3.1-8B2026.03 | 24.49 | |
| MSEBackbone=Llama-3.1-8B2026.03 | 23.95 | |
| OPTZero-shot=true, Number of Parameters=1.3B2026.03 | 23.75 | |
| EWQBackbone=Llama-3.1-8B2026.03 | 23.34 | |
| GPT-NeoZero-shot=true, Number of Parameters=1.3B2026.03 | 23.13 | |
| PythiaZero-shot=true, Number of Parameters=1.4B2026.03 | 22.77 | |
| TinyLLaMAZero-shot=true, Number of Parameters=1.1B2026.03 | 20.93 |