Long-context capability evaluation on RULER 8192 length
93.75AccuracyQwen3-30B A3B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B A3B-InstructBudget=Full2026.02 | 93.75 | |
| QUOKAModel=Qwen3-30B A3B-Instruct, Budget=25%2026.02 | 92.77 | |
| Qwen3-4BBudget=Full2026.02 | 91.68 | |
| QUOKAModel=Qwen3-4B, Budget=25%2026.02 | 91.35 | |
| Smollm3Budget=Full2026.02 | 83.46 | |
| Qwen2.5-3BBudget=Full2026.02 | 81.99 | |
| QUOKAModel=Smollm3, Budget=25%2026.02 | 81.45 | |
| Llama3.2-3BBudget=Full2026.02 | 81.33 | |
| QUOKAModel=GPT-OSS-20B, Budget=25%2026.02 | 80.66 | |
| QUOKAModel=Qwen2.5-3B, Budget=25%2026.02 | 79.78 | |
| QUOKAModel=Llama3.2-3B, Budget=25%2026.02 | 79.72 | |
| GPT-OSS-20BBudget=Full2026.02 | 79.32 |