Explanation Faithfulness Evaluation on BiasQA (test)
20.7GreedyDPO + RM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DPO + RMBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 20.7 | 19.5 | |
| DPO + RMCBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 18.2 | 13.9 | |
| DPO + RMDBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-GEMMA-27B2025.04 | 16.5 | 11.4 | |
| DPO + RMDBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 15.3 | 12.5 | |
| BaseBase Model=LLAMA-3.2-3B-IT, Training Method=Base, Reward Model=None2025.04 | 14.9 | 17.2 | |
| DPO + RMBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 14.1 | 12.4 | |
| DPO + RMCBase Model=LLAMA-3.2-3B-IT, Training Method=DPO, Reward Model=SK-LLAMA-8B2025.04 | 13.8 | 10.8 |