Question Answering on HELMET RAG subset
81.1HotpotQA AccuracyRAO(y)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| RAO(y)Context lengths=4k–128k, Reward function=R_AO, Fine-tuning=RL-based2026.01 | 81.1 | 67.7 | 92.1 | 80.3 | |
| RID(y)Context lengths=4k–128k, Reward function=R_ID, Fine-tuning=RL-based2026.01 | 75.2 | 65.5 | 91 | 77.2 | |
| RID+Q(y)Context lengths=4k–128k, Reward function=R_ID+Q, Fine-tuning=RL-based2026.01 | 74.1 | 59.1 | 85.5 | 72.9 | |
| BaseContext lengths=4k–128k, Protocol=With gold documents2026.01 | 72.2 | 70.7 | 85.8 | 76.2 | |
| RR+Judge(y)Context lengths=4k–128k, Reward function=R_R+Judge, Fine-tuning=RL-based2026.01 | 70.6 | 72.8 | 92.3 | 78.6 | |
| RID+C(y)Context lengths=4k–128k, Reward function=R_ID+C, Fine-tuning=RL-based2026.01 | 67.9 | 56.9 | 85.8 | 70.2 | |
| BaseContext lengths=4k–128k, Protocol=Standard retrieval2026.01 | 61 | 61.1 | 86.6 | 69.6 | |
| SFT AOContext lengths=4k–128k, Fine-tuning=Supervised2026.01 | 51.4 | 40.3 | 76.1 | 55.9 |