Abstract Generation on LaMP Abstract Gen.
39.8ROUGE-1C-BPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| C-BPOTraining Paradigm=Preference Opt., Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy, Mechanism=binary-feedback preference optimization2026.05 | 39.8 | 26.9 | |
| CoPETraining Paradigm=Preference Opt., Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy, Based on=DPO2026.05 | 39.2 | 23.9 | |
| OPPUTraining Paradigm=SFT-based, Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy2026.05 | 37.8 | 21.8 | |
| BCOTraining Paradigm=Preference Opt., Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy, Mechanism=binary-feedback preference optimization2026.05 | 37.3 | 23.1 | |
| KTOTraining Paradigm=Preference Opt., Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy, Mechanism=binary-feedback preference optimization2026.05 | 37 | 22.9 | |
| TAMTraining Paradigm=SFT-based, Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy2026.05 | 35.7 | 20.4 | |
| RAGTraining Paradigm=Non-Tuned, Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy2026.05 | 34.7 | 20.5 | |
| PAGTraining Paradigm=Non-Tuned, Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy2026.05 | 34.4 | 18.6 | |
| Base ModelTraining Paradigm=Non-Tuned, Backbone=Mistral-7B-Instruct-v0.3, Decoding Strategy=greedy2026.05 | 34.1 | 18.6 |