Chain-of-Thought Faithfulness Evaluation on Math Book
22.8Unfaithful Explanation RateDPO + RMC
Evaluation Results
| Method | Links | |
|---|---|---|
| DPO + RMCReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 22.8 | |
| DPO + RMCReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 23.6 | |
| DPO + RMDReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 24.5 | |
| Base LLAMA-3.1-8B-ITReward Model=None, Decoding=Greedy2025.04 | 24.8 | |
| DPO + RMReward Model=SK-LLAMA-8B, Decoding=Greedy2025.04 | 25.7 | |
| Base LLAMA-3.1-8B-ITReward Model=None, Decoding=Maj@162025.04 | 27.2 | |
| DPO + RMReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 27.2 | |
| DPO + RMDReward Model=SK-GEMMA-27B, Decoding=Greedy2025.04 | 28.3 | |
| DPO + RMCReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 31.6 | |
| DPO + RMCReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 32.5 | |
| DPO + RMDReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 33.6 | |
| DPO + RMReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 33.9 | |
| DPO + RMReward Model=SK-LLAMA-8B, Decoding=Maj@162025.04 | 34 | |
| DPO + RMDReward Model=SK-GEMMA-27B, Decoding=Maj@162025.04 | 35.2 |