Long-context capability evaluation on RULER 4096 length
94.08AccuracyQwen3-30B A3B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B A3B-InstructBudget=Full2026.02 | 94.08 | |
| Qwen3-4BBudget=Full2026.02 | 93.32 | |
| QUOKAModel=Qwen3-30B A3B-Instruct, Budget=25%2026.02 | 93.25 | |
| QUOKAModel=Qwen3-4B, Budget=25%2026.02 | 92.5 | |
| Smollm3Budget=Full2026.02 | 91.12 | |
| QUOKAModel=Smollm3, Budget=25%2026.02 | 89.6 | |
| Qwen2.5-3BBudget=Full2026.02 | 89.56 | |
| Llama3.2-3BBudget=Full2026.02 | 87.5 | |
| QUOKAModel=Llama3.2-3B, Budget=25%2026.02 | 86.94 | |
| QUOKAModel=Qwen2.5-3B, Budget=25%2026.02 | 86.07 | |
| GPT-OSS-20BBudget=Full2026.02 | 79.35 | |
| QUOKAModel=GPT-OSS-20B, Budget=25%2026.02 | 77.4 |