Long-context capability evaluation on RULER 32768 length
91.87AccuracyQwen3-30B A3B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B A3B-InstructBudget=Full2026.02 | 91.87 | |
| QUOKAModel=Qwen3-30B A3B-Instruct, Budget=25%2026.02 | 91.08 | |
| Qwen3-4BBudget=Full2026.02 | 88.54 | |
| QUOKAModel=Qwen3-4B, Budget=25%2026.02 | 87.87 | |
| Llama3.2-3BBudget=Full2026.02 | 76.31 | |
| GPT-OSS-20BBudget=Full2026.02 | 75.47 | |
| Smollm3Budget=Full2026.02 | 75.18 | |
| QUOKAModel=Llama3.2-3B, Budget=25%2026.02 | 74.14 | |
| QUOKAModel=Smollm3, Budget=25%2026.02 | 73.55 | |
| QUOKAModel=GPT-OSS-20B, Budget=25%2026.02 | 73.45 | |
| Qwen2.5-3BBudget=Full2026.02 | 71.69 | |
| QUOKAModel=Qwen2.5-3B, Budget=25%2026.02 | 68.84 |