Overall Language Performance on Aggregate All Benchmarks
62.03Average AccuracyHSA-UL-Inst
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HSA-UL-InstArchitecture=MoE, Total Parameters=8B, Activated Parameters=1B, Training Tokens=8T, Supervised fine-tuning=true2025.11 | 62.03 | — | |
| Qwen3-InstArchitecture=Dense, Total Parameters=1.7B, Activated Parameters=1.7B, Training Tokens=36T, Supervised fine-tuning=true2025.11 | 60.76 | — | |
| T-SPINIteration=Iter42026.01 | 43.47 | 0.24 | |
| T-SPINIteration=Iter32026.01 | 43.23 | 0.44 | |
| T-SPINIteration=Iter22026.01 | 42.79 | 0.23 | |
| T-SPINIteration=Iter12026.01 | 42.56 | 2.81 | |
| SFT2026.01 | 42.01 | — | |
| SPINIteration=Iter22026.01 | 41.14 | 1.3 | |
| SPINIteration=Iter32026.01 | 40.92 | -0.22 | |
| SPINIteration=Iter42026.01 | 40.62 | -0.3 | |
| Qwen3-InstArchitecture=Dense, Total Parameters=0.6B, Activated Parameters=0.6B, Training Tokens=36T, Supervised fine-tuning=true2025.11 | 40.5 | — | |
| SPINIteration=Iter02026.01 | 40.07 | — | |
| SPINIteration=Iter12026.01 | 39.84 | -0.23 | |
| T-SPINIteration=Iter02026.01 | 39.75 | — | |
| Zephyr-7B2026.01 | 38.56 | — | |
| HSA-UL-InstArchitecture=Dense, Total Parameters=0.5B, Activated Parameters=0.5B, Training Tokens=4T, Supervised fine-tuning=true2025.11 | 36.48 | — |