Natural Language Inference on ANLI R1 (Accuracy, Macro-F1)
47.3AccuracyQwen1.5-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen1.5-7BFine-tuning protocol=None2026.02 | 47.3 | 38.84 | |
| Krause-Qwen1.5-7BWindow size=32, top-k=162026.02 | 41.3 | 37.88 | |
| Krause-Qwen1.5-7BWindow size=18, top-k=122026.02 | 41.2 | 37.64 | |
| Krause-Qwen1.5-7BWindow size=48, top-k=242026.02 | 40.9 | 37.94 | |
| Qwen1.5-7BFine-tuning protocol=LoRA2026.02 | 40.4 | 37.34 | |
| Krause-Llama3-8B2026.02 | 40.3 | 33.01 | |
| Llama3-8Bfine-tuning=LoRA2026.02 | 38.7 | 30.62 | |
| Llama3-8B2026.02 | 33.4 | 16.69 |