Explanation Faithfulness Evaluation on Math Book (test)
31.4Greedy ScoreDPO + RMD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DPO + RMDBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 31.4 | 40.2 | |
| DPO + RMBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 30.8 | 39.9 | |
| DPO + RMDBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 28.9 | 36.5 | |
| DPO + RMBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 27.8 | 39.9 | |
| DPO + RMCBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 27.7 | 33.6 | |
| DPO + RMCBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 25.2 | 30.3 | |
| BaseBase Model=LLAMA-3.2-3B-IT, Training Method=Base, Reward Model=None2025.04 | 23.6 | 21.1 |