Average QA and Reasoning on NQ, TriviaQA, HotpotQA, and GSM8K
72.5Average AccuracyKite-best
Evaluation Results
| Method | Links | |
|---|---|---|
| Kite-bestModel=GPT-4.1, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 72.5 | |
| DPP-bestModel=GPT-4.1, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 71.7 | |
| KNN-bestModel=GPT-4.1, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 71.5 | |
| BM25Model=GPT-4.1, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 71.2 | |
| Kite-bestModel=GPT-5.2, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 71 | |
| DPP-bestModel=GPT-5.2, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 70.1 | |
| KNN-bestModel=GPT-5.2, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 69.8 | |
| BM25Model=GPT-5.2, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 68.2 | |
| Kite-bestModel=GPT-4o-mini, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 65.3 | |
| KNN-bestModel=GPT-4o-mini, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 65.1 | |
| DPP-bestModel=GPT-4o-mini, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 65.1 | |
| BM25Model=GPT-4o-mini, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 64.1 | |
| Kite-bestModel=Claude-Haiku-4.5, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 62.1 | |
| DPP-bestModel=Claude-Haiku-4.5, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 61 | |
| KNN-bestModel=Claude-Haiku-4.5, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 60.3 | |
| BM25Model=Claude-Haiku-4.5, Exemplar budget (r)=5, Embedding Encoder=OpenAI large text embeddings2025.09 | 59.1 |