Dialogue Summarization on DialogSum
48.36R-LFull + full parameters
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Full + full parametersBackbone=Qwen-2.5-7B-Instruct, Data Selection Method=Full (full dataset), Fine-tuning Strategy=full parameters, Data Ratio (ρD)=100%, Head Ratio (ρP)=100%2026.05 | 48.36 | — | — | — | |
| Full + full parametersBackbone=Llama-3-8B-Instruct, Data Selection Method=Full (full dataset), Fine-tuning Strategy=full parameters, Data Ratio (ρD)=100%, Head Ratio (ρP)=100%2026.05 | 46.89 | — | — | — | |
| P2D† + P2D‡Backbone=Qwen-2.5-7B-Instruct, Data Selection Method=P2D†, Fine-tuning Strategy=P2D‡, Data Ratio (ρD)=10%, Head Ratio (ρP)=10%2026.05 | 46.45 | — | — | — | |
| Full + full parametersBackbone=Qwen-3-8B, Data Selection Method=Full (full dataset), Fine-tuning Strategy=full parameters, Data Ratio (ρD)=100%, Head Ratio (ρP)=100%2026.05 | 44.22 | — | — | — | |
| P2D† + P2D‡Backbone=Qwen-3-8B, Data Selection Method=P2D†, Fine-tuning Strategy=P2D‡, Data Ratio (ρD)=10%, Head Ratio (ρP)=10%2026.05 | 43.23 | — | — | — | |
| P2D† + P2D‡Backbone=Llama-3-8B-Instruct, Data Selection Method=P2D†, Fine-tuning Strategy=P2D‡, Data Ratio (ρD)=10%, Head Ratio (ρP)=10%2026.05 | 42.45 | — | — | — | |
| InstructDS2023.10 | 39.4 | 47.8 | 22.2 | 47 | |
| BARTmode=fine-tuned2023.10 | 38.6 | 47.3 | 21.3 | 45.8 | |
| AMiDTeacher-Student Architecture=Gemma-7B-It to Gemma-2B-It, alpha=!= +/- 12025.10 | 35.22 | — | — | — | |
| TAIDTeacher-Student Architecture=Gemma-7B-It to Gemma-2B-It2025.10 | 34.93 | — | — | — | |
| ABKDTeacher-Student Architecture=Gemma-7B-It to Gemma-2B-It2025.10 | 34.88 | — | — | — | |
| Flan-UL22023.10 | 33.3 | 40.8 | 16.5 | 40.9 | |
| AMiDTeacher-Student Architecture=Qwen2-7B-It to Qwen2-0.5B-It, alpha=!= +/- 12025.10 | 32.51 | — | — | — | |
| Flan-T5-XXL2023.10 | 32.4 | 39.3 | 15.8 | 39.5 | |
| DistiLLMTeacher-Student Architecture=Qwen2-7B-It to Qwen2-0.5B-It2025.10 | 32.27 | — | — | — | |
| ABKDTeacher-Student Architecture=Qwen2-7B-It to Qwen2-0.5B-It2025.10 | 31.67 | — | — | — | |
| TAIDTeacher-Student Architecture=Qwen2-7B-It to Qwen2-0.5B-It2025.10 | 31.65 | — | — | — | |
| Flan-T5-Large2023.10 | 30.9 | 38.8 | 14.4 | 38.7 | |
| ChatGPT2023.10 | 29.8 | 38.4 | 12.9 | 38.8 | |
| DistiLLMTeacher-Student Architecture=Gemma-7B-It to Gemma-2B-It2025.10 | 26.51 | — | — | — | |
| VanillaBackbone=Qwen-2.5-7B-Instruct, Data Selection Method=None, Fine-tuning Strategy=None, Data Ratio (ρD)=–, Head Ratio (ρP)=–2026.05 | 25.41 | — | — | — | |
| VanillaBackbone=Qwen-3-8B, Data Selection Method=None, Fine-tuning Strategy=None, Data Ratio (ρD)=–, Head Ratio (ρP)=–2026.05 | 22.97 | — | — | — | |
| VanillaBackbone=Llama-3-8B-Instruct, Data Selection Method=None, Fine-tuning Strategy=None, Data Ratio (ρD)=–, Head Ratio (ρP)=–2026.05 | 20.16 | — | — | — | |
| Alpaca2023.10 | 18.8 | 25.5 | 4.9 | 18 |