Safety Evaluation on XSTest (out-of-domain)
88.67Accuracycalibration-aware reinforcement learning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| calibration-aware reinforcement learningBackbone=Qwen3-8B2026.01 | 88.67 | 6.41 | |
| GRPOBackbone=Qwen3-4B2026.01 | 87.78 | 12.21 | |
| calibration-aware reinforcement learningBackbone=Qwen3-4B2026.01 | 87.56 | 8.89 | |
| SFTBackbone=Qwen3-8B2026.01 | 86.78 | 6.84 | |
| SFTBackbone=Qwen3-4B2026.01 | 86.22 | 8.26 | |
| GRPOBackbone=Qwen3-8B2026.01 | 86.22 | 13.54 | |
| BaseBackbone=Qwen3-8B2026.01 | 83.56 | 15.45 | |
| BaseBackbone=Qwen3-4B2026.01 | 80.89 | 18.18 | |
| calibration-aware reinforcement learningBackbone=Qwen3-1.7B2026.01 | 80 | 15.48 | |
| GRPOBackbone=Qwen3-1.7B2026.01 | 79.78 | 20.22 | |
| SFTBackbone=Qwen3-1.7B2026.01 | 76 | 11.93 | |
| BaseBackbone=Qwen3-1.7B2026.01 | 74.89 | 22.97 |