Question Answering on ARC-IT
95AccuracyQwen3-30B-A3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3BGroup=Larger, Configuration=Standard-config2026.03 | 95 | |
| Qwen3-30B-A3BGroup=Larger, Configuration=Optimal-config2026.03 | 95 | |
| Gpt-oss-20b-highGroup=Larger, Configuration=Optimal-config2026.03 | 93.2 | |
| Gpt-oss-20b-highGroup=Larger, Configuration=Standard-config2026.03 | 92.6 | |
| Qwen3-14BGroup=Larger, Configuration=Standard-config2026.03 | 89.2 | |
| Qwen3-14BGroup=Larger, Configuration=Optimal-config2026.03 | 89.2 | |
| gemma-3-12b-itGroup=Larger, Configuration=Standard-config2026.03 | 88.5 | |
| gemma-2-9b-itGroup=Comparable, Configuration=Standard-config2026.03 | 88.4 | |
| gemma-3-12b-itGroup=Larger, Configuration=Optimal-config2026.03 | 88.1 | |
| gemma-2-9b-itGroup=Comparable, Configuration=Optimal-config2026.03 | 87.6 | |
| EngGPT2-16B-A3BGroup=Comparable, Configuration=Standard-config2026.03 | 85.6 | |
| EngGPT2-16B-A3BGroup=Comparable, Configuration=Optimal-config2026.03 | 85.6 | |
| Llama-3.1-8B-InstructGroup=Comparable, Configuration=Standard-config2026.03 | 81.4 | |
| Llama-3.1-8B-InstructGroup=Comparable, Configuration=Optimal-config2026.03 | 80 | |
| Moonlight-16B-A3B-InstructGroup=Comparable, Configuration=Standard-config2026.03 | 63.1 | |
| Moonlight-16B-A3B-InstructGroup=Comparable, Configuration=Optimal-config2026.03 | 63.1 |