Response Alignment on HUMANUAL (test)
6.08Alignment Score (Chat)HUMANLM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| HUMANLMTraining Strategy=State Alignment2026.02 | 6.08 | 9.55 | 18.5 | 25.6 | 12.6 | 6.71 | 13.2 | |
| GRPOTraining Strategy=GRPO2026.02 | 5.83 | 7.92 | 13.3 | 18.2 | 10.9 | 5.9 | 10.3 | |
| SFTTraining Strategy=SFT2026.02 | 4.57 | 3.1 | 9.3 | 11.3 | 6.3 | 4.3 | 6.5 | |
| Qwen3-8bBackbone=Qwen3-8b2026.02 | 3.9 | 5.68 | 13.6 | 18.7 | 10.1 | 4.76 | 9.5 | |
| GRPO-thinkTraining Strategy=GRPO, Reasoning Traces=true2026.02 | 3.16 | 7.04 | 12.8 | 23.8 | 10.6 | 4.78 | 10.4 | |
| SFT-thinkTraining Strategy=SFT, Reasoning Traces=true2026.02 | 2.5 | 6 | 13.4 | 16.7 | 9.2 | 3.94 | 8.6 | |
| UserLM2026.02 | 2.47 | — | — | — | — | — | — | |
| Qwen3-8b-thinkBackbone=Qwen3-8b, Reasoning Traces=true2026.02 | 2.16 | 4.83 | 12.8 | 20.4 | 7 | 3.22 | 8.4 |