Decision Alignment on SALESSIM 1.0 (test)
79Male Alignment ScoreGemma4+Reasoning (31B)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Gemma4+Reasoning (31B)Model Source=Open-Source, Parameters=31B, Reasoning Mode=enabled2026.05 | 79 | 81.2 | 67.8 | 84.4 | 78.2 | 81 | 78.6 | |
| ChatGPT-5.4Model Source=Closed-Source2026.05 | 73.7 | 79.7 | 68.7 | 66.3 | 81 | 76.9 | 74.3 | |
| UserGRPOModel Source=Open-Source, Backbone=Qwen+Reasoning (8B), Training=UserGRPO2026.05 | 63.2 | — | 51.3 | 57.8 | 80.3 | 74.8 | 65.5 | |
| Qwen+Reasoning (8B) + SFTModel Source=Open-Source, Parameters=8B, Reasoning Mode=enabled, Fine-tuning=Supervised Fine-Tuning2026.05 | 61.8 | — | 50.4 | 44.6 | 56.5 | 50.3 | 52.7 | |
| Qwen+Reasoning (8B) + Human SteeringModel Source=Open-Source, Parameters=8B, Reasoning Mode=enabled, Human Steering=true2026.05 | 57.9 | 63.8 | 48.7 | 59 | 71.4 | 67.3 | 61.4 | |
| Qwen+Reasoning (8B)Model Source=Open-Source, Parameters=8B, Reasoning Mode=enabled2026.05 | 53.9 | 65.2 | 41.7 | 39.8 | 55.1 | 54.4 | 51.7 | |
| Gemma3+Reasoning (12B)Model Source=Open-Source, Parameters=12B, Reasoning Mode=enabled2026.05 | 52.6 | 66.7 | 53 | 57.8 | 61.9 | 63.3 | 59.2 | |
| GLM+ReasoningModel Source=Open-Source, Reasoning Mode=enabled2026.05 | 48.7 | 46.4 | 32.2 | 43.4 | 46.3 | 49 | 44.3 | |
| Gemma3+Reasoning (12B) + Human SteeringModel Source=Open-Source, Parameters=12B, Reasoning Mode=enabled, Human Steering=true2026.05 | 40.8 | 58 | 44.3 | 43.4 | 66.7 | 48.3 | 50.3 | |
| Gemini-3-FlashModel Source=Closed-Source2026.05 | 39.5 | 59.4 | 63.5 | 47 | 63.9 | 50.3 | 53.9 | |
| GLM-Thinking (9B)Model Source=Open-Source, Parameters=9B2026.05 | 25 | 40.1 | 20.9 | 27.7 | 40.1 | 40.8 | 32.4 | |
| GLM+Reasoning + Human SteeringModel Source=Open-Source, Reasoning Mode=enabled, Human Steering=true2026.05 | 21.1 | 29 | 27 | 18.1 | 18.4 | 20.4 | 22.3 |