Event timeline summarization on Event timeline summarization dataset
73.9PrecisionDeepSeek-R1-671B (5-shot)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DeepSeek-R1-671B (5-shot)Base Model=DeepSeek-R1-671B, Strategy=5-shot, Task-specific fine-tuning=False2026.05 | 73.9 | 79.2 | 76.4 | 74.8 | 0.89 | |
| DeepSeek-R1-671B (0-shot)Base Model=DeepSeek-R1-671B, Strategy=0-shot, Task-specific fine-tuning=False2026.05 | 73.6 | 78.7 | 76.1 | 74.5 | 0.89 | |
| Qwen2.5-7B-Instruct (fine-tuned)Base Model=Qwen2.5-7B-Instruct, Strategy=Multi-task learning framework, Task-specific fine-tuning=True2026.05 | 73.2 | 79.5 | 76.2 | 73.8 | 0.87 | |
| Qwen2.5-3B-Instruct (fine-tuned)Base Model=Qwen2.5-3B-Instruct, Strategy=Multi-task learning framework, Task-specific fine-tuning=True2026.05 | 66.8 | 74.5 | 70.4 | 68.1 | 0.83 | |
| Qwen2.5-7B-Instruct (5-shot)Base Model=Qwen2.5-7B-Instruct, Strategy=5-shot, Task-specific fine-tuning=False2026.05 | 64.1 | 66.2 | 65.1 | 64.5 | 0.7 | |
| Qwen2.5-7B-Instruct (0-shot)Base Model=Qwen2.5-7B-Instruct, Strategy=0-shot, Task-specific fine-tuning=False2026.05 | 62.7 | 64.8 | 63.7 | 63.1 | 0.68 | |
| Qwen2.5-3B-Instruct (5-shot)Base Model=Qwen2.5-3B-Instruct, Strategy=5-shot, Task-specific fine-tuning=False2026.05 | 60.5 | 61.8 | 61.1 | 60.5 | 0.67 | |
| Qwen2.5-3B-Instruct (0-shot)Base Model=Qwen2.5-3B-Instruct, Strategy=0-shot, Task-specific fine-tuning=False2026.05 | 59.2 | 60.1 | 59.6 | 59.3 | 0.65 |