Context Compression for Question Answering on Aggregated NQ, TQA, HQA, 2Wiki, Musique
34EMLooComp
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LooCompAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 34 | 43.6 | 0.098 | 12.8 | |
| ProvenceAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 32.4 | 42 | 0.126 | 17.9 | |
| LongLLMLinAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 32.3 | 41.7 | 0.853 | 41.8 | |
| CompActAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 32.2 | 41.6 | 3.67 | 7.7 | |
| EXITAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 32 | 41.3 | 0.921 | 46.2 | |
| RefinerAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 31.6 | 40.9 | 3.218 | 8.5 | |
| RECOMP-absAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 30.4 | 39.7 | 0.91 | 4.3 | |
| RECOMP-extAggregation=2-stage averaging (2 readers × 2 retrieved depths × 5 datasets)2026.03 | 29.1 | 38 | 0.023 | 30.4 |