Chain-of-Thought Faithfulness Evaluation on BiasQA
2.4Unfaithful Explanation RateDPO + RMD
Evaluation Results
| Method | Links | |
|---|---|---|
| DPO + RMDReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 2.4 | |
| DPO + RMCReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 3.9 | |
| DPO + RMCReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 7.4 | |
| DPO + RMDReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 7.5 | |
| DPO + RMDReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 8 | |
| DPO + RMReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 9.8 | |
| DPO + RMDReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 10.7 | |
| DPO + RMCReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 11.7 | |
| DPO + RMCReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 12.3 | |
| DPO + RMReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 13.2 | |
| Base LLAMA-3.1-8B-ITReward Model=None, Decoding=Greedy2025.04 | 13.7 | |
| Base LLAMA-3.1-8B-ITReward Model=None, Decoding=Maj@162025.04 | 14.1 | |
| DPO + RMReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 20.8 | |
| DPO + RMReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 25 |