Question Classification on TREC LongBench
68.5AccuracyBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineModel=Llama 2-13B2026.02 | 68.5 | |
| KIVIModel=Llama 2-13B2026.02 | 68 | |
| KIVISinkModel=Llama 2-13B2026.02 | 68 | |
| InnerQBaseModel=Llama 2-13B2026.02 | 67.5 | |
| InnerQHybridModel=Llama 2-13B2026.02 | 67.5 | |
| InnerQSmallModel=Llama 2-13B2026.02 | 66.5 | |
| KIVIModel=Llama 2-7B2026.02 | 64.5 | |
| KIVISinkModel=Llama 2-7B2026.02 | 64.5 | |
| InnerQBaseModel=Llama 2-7B2026.02 | 64.5 | |
| InnerQHybridModel=Llama 2-7B2026.02 | 64.5 | |
| BaselineModel=Llama 2-7B2026.02 | 64 | |
| InnerQSmallModel=Llama 2-7B2026.02 | 62 | |
| BaselineModel=Llama 3.1-8B2026.02 | 39.5 | |
| InnerQSmallModel=Llama 3.1-8B2026.02 | 38 | |
| InnerQHybridModel=Llama 3.1-8B2026.02 | 37.5 | |
| InnerQBaseModel=Llama 3.1-8B2026.02 | 37 | |
| KIVISinkModel=Llama 3.1-8B2026.02 | 34.5 | |
| KIVIModel=Llama 3.1-8B2026.02 | 32.5 | |
| InnerQBaseModel=Llama 3.2-3B2026.02 | 10.5 | |
| BaselineModel=Llama 3.2-3B2026.02 | 10.03 | |
| InnerQSmallModel=Llama 3.2-3B2026.02 | 9.1 | |
| KIVISinkModel=Llama 3.2-3B2026.02 | 9.03 | |
| KIVIModel=Llama 3.2-3B2026.02 | 8.53 | |
| InnerQHybridModel=Llama 3.2-3B2026.02 | 8.1 | |
| InnerQBaseModel=Llama 3.2-1B2026.02 | 4.75 | |
| InnerQHybridModel=Llama 3.2-1B2026.02 | 4.5 | |
| KIVISinkModel=Llama 3.2-1B2026.02 | 3.5 | |
| InnerQSmallModel=Llama 3.2-1B2026.02 | 3.5 | |
| KIVIModel=Llama 3.2-1B2026.02 | 2.75 | |
| BaselineModel=Llama 3.2-1B2026.02 | 2 |