Question Answering on PubMedQA long-context (PQA-L)
61.1Macro-F1Full context
Evaluation Results
| Method | Links | |
|---|---|---|
| Full contextBudget (tokens)=Full, Downstream Classifier=GPT-4o2026.05 | 61.1 | |
| MMRBudget (tokens)=256, Downstream Classifier=GPT-4o2026.05 | 59.8 | |
| RCDBudget (tokens)=256, Downstream Classifier=GPT-4o2026.05 | 59.8 | |
| LeadBudget (tokens)=256, Downstream Classifier=GPT-4o2026.05 | 58.7 | |
| ShuffledBudget (tokens)=256, Downstream Classifier=GPT-4o2026.05 | 58.7 | |
| ShuffledBudget (tokens)=128, Downstream Classifier=GPT-4o2026.05 | 51.4 | |
| RCDBudget (tokens)=128, Downstream Classifier=GPT-4o2026.05 | 50.3 | |
| ShuffledBudget (tokens)=96, Downstream Classifier=GPT-4o2026.05 | 48.4 | |
| MMRBudget (tokens)=128, Downstream Classifier=GPT-4o2026.05 | 46.7 | |
| RCDBudget (tokens)=96, Downstream Classifier=GPT-4o2026.05 | 45.7 | |
| ShuffledBudget (tokens)=64, Downstream Classifier=GPT-4o2026.05 | 41.2 | |
| MMRBudget (tokens)=96, Downstream Classifier=GPT-4o2026.05 | 40.9 | |
| RCDBudget (tokens)=64, Downstream Classifier=GPT-4o2026.05 | 39.6 | |
| LeadBudget (tokens)=128, Downstream Classifier=GPT-4o2026.05 | 37.2 | |
| MMRBudget (tokens)=64, Downstream Classifier=GPT-4o2026.05 | 32.8 | |
| LeadBudget (tokens)=96, Downstream Classifier=GPT-4o2026.05 | 28.4 | |
| LeadBudget (tokens)=64, Downstream Classifier=GPT-4o2026.05 | 23.3 |