Question Answering on Administrative Dataset (test)
89.6Acceptance RateDerivation Prompting
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Derivation PromptingModel=Claude Opus, Evaluator=Claude Opus, Context (k)=3, Retrieval=Cross-Encoder, Prompting Strategy=Derivation Prompting2026.05 | 89.6 | 10 | 4 | 92 | 25 | 4 | 3.07 | 0.79 | |
| Derivation PromptingModel=Claude Haiku, Evaluator=Claude Opus, Context (k)=3, Retrieval=Cross-Encoder, Prompting Strategy=Derivation Prompting2026.05 | 82.2 | 21 | 3 | 95 | 12 | 4 | 2.81 | 0.91 | |
| RAGModel=Claude Opus, Evaluator=Claude Opus, Context (k)=3, Retrieval=Cross-Encoder, Prompting Strategy=RAG2026.05 | 77.8 | 15 | 15 | 75 | 27 | 3 | 2.91 | 0.92 | |
| Long contextModel=Claude Opus, Evaluator=Claude Opus, Context (k)=3, Prompting Strategy=Long context2026.05 | 76.3 | 17 | 15 | 73 | 25 | 5 | 2.9 | 0.97 | |
| RAGModel=Claude Haiku, Evaluator=Claude Opus, Context (k)=3, Retrieval=Cross-Encoder, Prompting Strategy=RAG2026.05 | 72.6 | 17 | 20 | 74 | 20 | 4 | 2.81 | 0.94 | |
| Long contextModel=Claude Haiku, Evaluator=Claude Opus, Context (k)=3, Prompting Strategy=Long context2026.05 | 65.2 | 35 | 12 | 61 | 22 | 5 | 2.63 | 1.14 |