Utility Preservation on MUSE-Books Harry Potter (retain set)
84.95R-RetainGA (DQA_f) + KL (Dr)
Evaluation Results
| Method | Links | |
|---|---|---|
| GA (DQA_f) + KL (Dr)Backbone=Llama 3.2-3B-Instruct, Training Data Format=QA samples, Regularization=KL-divergence2026.01 | 84.95 | |
| Base Model (Llama3.2-3B)Backbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content2026.01 | 84.29 | |
| NPO + KL (Dr)Backbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content, Regularization=KL-divergence2026.01 | 80.28 | |
| GA + KL (Dr)Backbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content, Regularization=KL-divergence2026.01 | 78.67 | |
| DUETBackbone=Llama 3.2-3B-Instruct, Training Data Format=Dquery_f ∪ Dr2026.01 | 78.33 | |
| GA (DQA_f)Backbone=Llama 3.2-3B-Instruct, Training Data Format=QA samples2026.01 | 75.8 | |
| Refusal-TrainingBackbone=Llama 3.2-3B-Instruct, Training Data Format=DQR_f ∪ Dr2026.01 | 75.32 | |
| NPOBackbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content2026.01 | 69.69 | |
| FLATBackbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content2026.01 | 58.33 | |
| NPO (DQA_f)Backbone=Llama 3.2-3B-Instruct, Training Data Format=QA samples2026.01 | 46.2 | |
| SimNPOBackbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content2026.01 | 43.09 | |
| NPO (DQA_f) + KL (Dr)Backbone=Llama 3.2-3B-Instruct, Training Data Format=QA samples, Regularization=KL-divergence2026.01 | 26.38 | |
| GABackbone=Llama 3.2-3B-Instruct, Training Data Format=Raw book content2026.01 | 0 |