Relevance Assessment on NoteRel (test)
77.1F1-Score (0)R³A
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| R³ATraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-7B, Parameter Update=w/ parameter update2025.08 | 77.1 | 56 | 64.2 | 83.1 | 73.3 | 65.2 | |
| R³A-ZeroTraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-7B, Parameter Update=w/ parameter update2025.08 | 75.8 | 51.7 | 63.3 | 82.4 | 72.5 | 63.6 | |
| R1Training Strategy=Reinforcement Learning, Backbone=Qwen2.5-7B, Parameter Update=w/ parameter update2025.08 | 74.4 | 49.6 | 63.7 | 81.2 | 72.7 | 63.2 | |
| R³ATraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-1.5B, Parameter Update=w/ parameter update2025.08 | 72 | 51.5 | 62.9 | 80.8 | 69.6 | 61.7 | |
| R³A-Distill-1.5BTraining Strategy=Distilling, Parameter Update=Online Serving2025.08 | 71.4 | 55.9 | 60.3 | 78.3 | 70.5 | 62 | |
| R³A-ZeroTraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-1.5B, Parameter Update=w/ parameter update2025.08 | 71.3 | 49.8 | 60.5 | 79.4 | 68.3 | 60.4 | |
| Qwen2.5-7BTraining Strategy=Supervised Fine-Tuning, Parameter Update=w/ parameter update2025.08 | 71 | 55.6 | 52.1 | 78.2 | 66.8 | 60.3 | |
| R1Training Strategy=Reinforcement Learning, Backbone=Qwen2.5-1.5B, Parameter Update=w/ parameter update2025.08 | 70.7 | 46.9 | 62 | 78.3 | 69 | 59.7 | |
| Qwen2.5-1.5B + pretrainedTraining Strategy=Supervised Fine-Tuning, Parameter Update=w/ parameter update2025.08 | 70.1 | 55.3 | 56 | 77.3 | 68.2 | 60 | |
| Qwen2.5-7B + pretrainedTraining Strategy=Supervised Fine-Tuning, Parameter Update=w/ parameter update2025.08 | 69.9 | 54.9 | 53.9 | 77 | 67.6 | 61.4 | |
| Qwen2.5-1.5BTraining Strategy=Supervised Fine-Tuning, Parameter Update=w/ parameter update2025.08 | 68.4 | 51.8 | 57.7 | 76.3 | 68.5 | 59 | |
| R1-ZeroTraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-7B, Parameter Update=w/ parameter update2025.08 | 67.5 | 47.2 | 62.5 | 75.6 | 71.7 | 59.3 | |
| R1-ZeroTraining Strategy=Reinforcement Learning, Backbone=Qwen2.5-1.5B, Parameter Update=w/ parameter update2025.08 | 66.7 | 45.3 | 58.5 | 75.1 | 68.2 | 56.8 | |
| GPT-4oMethod Family=UMbrela, Training Strategy=Prompting, Parameter Update=w/o parameter update2025.08 | 63.3 | 53.8 | 59.6 | 73 | 69.8 | 58.2 | |
| QwQ-32BMethod Family=UMbrela, Training Strategy=Prompting, Parameter Update=w/o parameter update2025.08 | 62.3 | 43.6 | 63.5 | 70.3 | 69.4 | 55.9 | |
| DeepSeek-R1Method Family=UMbrela, Training Strategy=Prompting, Parameter Update=w/o parameter update2025.08 | 61.9 | 42.8 | 63 | 72.1 | 71.8 | 56 | |
| DeepSeek-V3Method Family=UMbrela, Training Strategy=Prompting, Parameter Update=w/o parameter update2025.08 | 56.6 | 46.3 | 60.4 | 69.4 | 69.8 | 54.1 | |
| Qwen2.5-7BMethod Family=UMbrela, Training Strategy=Prompting, Parameter Update=w/o parameter update2025.08 | 48.1 | 46.6 | 54.6 | 65.1 | 66.3 | 49.6 |