Token-level length-controlled question answering on ELI5 (test)
10.33MAEICL+Feedback
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ICL+FeedbackBackbone=Qwen3-8B, Strategy=ICL+Feedback2026.01 | 10.33 | 68.65 | 7.83 | |
| SFT+FeedbackBackbone=Qwen3-8B, Strategy=SFT+Feedback2026.01 | 16.41 | 47.9 | 8.01 | |
| SFT+FeedbackBackbone=LLaMA-3.1-8B-Instruct, Strategy=SFT+Feedback2026.01 | 18.39 | 46.41 | 7.28 | |
| SFTBackbone=Qwen3-8B, Strategy=SFT2026.01 | 23.72 | 30.59 | 8.14 | |
| FeedbackBackbone=LLaMA-3.1-8B-Instruct, Strategy=Feedback2026.01 | 24.48 | 37.94 | 7.38 | |
| ICL+FeedbackBackbone=LLaMA-3.1-8B-Instruct, Strategy=ICL+Feedback2026.01 | 25.28 | 39.18 | 7.25 | |
| ICLBackbone=Qwen3-8B, Strategy=ICL2026.01 | 30.64 | 19.65 | 7.8 | |
| SFTBackbone=LLaMA-3.1-8B-Instruct, Strategy=SFT2026.01 | 31.91 | 18.6 | 7.49 | |
| ICLBackbone=LLaMA-3.1-8B-Instruct, Strategy=ICL2026.01 | 53.83 | 9.45 | 7.43 | |
| Qwen3-8BBackbone=Qwen3-8B, Strategy=Baseline2026.01 | 59.84 | 9.35 | 7.83 | |
| FeedbackBackbone=Qwen3-8B, Strategy=Feedback2026.01 | 60.99 | 37.09 | 6.78 | |
| LLaMA-3.1-8B-InstructBackbone=LLaMA-3.1-8B-Instruct, Strategy=Baseline2026.01 | 70.03 | 9.05 | 7.44 |