General Language Capability Evaluation on General Capability Suite Aggregate
62.51General Capability Avg. AccuracyBase
Evaluation Results
| Method | Links | |
|---|---|---|
| BaseBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 62.51 | |
| AlphaTokenBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 62.29 | |
| TI-DPOBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 61.61 | |
| ConfPOBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 61.49 | |
| DPOBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 60.8 | |
| SePOBackbone=Qwen-3.5-9B, Warm-start Reference=UltraChat-200k2026.06 | 60.21 | |
| BaseBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 45.14 | |
| AlphaTokenBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 44.42 | |
| ConfPOBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 44.3 | |
| TI-DPOBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 44.28 | |
| DPOBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 43.55 | |
| SePOBackbone=Gemma-3-4B, Warm-start Reference=UltraChat-200k2026.06 | 42.69 | |
| BaseBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 41.91 | |
| AlphaTokenBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 41.37 | |
| TI-DPOBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 40.93 | |
| ConfPOBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 40.46 | |
| DPOBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 40.18 | |
| SePOBackbone=Llama-3.2-3B, Warm-start Reference=UltraChat-200k2026.06 | 38.59 |