Question Answering on fine_facts suite adversarial (801 QA pairs)
99.6Accuracy (fine_facts adversarial)Original
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OriginalModel=GPT-4o, Compression=None2026.05 | 99.6 | — | |
| TEModel=GPT-4o2026.05 | 96.5 | 3.1 | |
| OriginalModel=GPT-4o-mini, Compression=None2026.05 | 93.8 | — | |
| LLMLingua-2Model=GPT-4o, Retention=50%2026.05 | 93.3 | 6.3 | |
| TEModel=GPT-4o-mini2026.05 | 84.3 | 9.5 | |
| LLMLingua-2Model=GPT-4o-mini, Retention=50%2026.05 | 82 | 11.8 |