Safety and Helpfulness Evaluation on Phone-Harm Harm-150
0.4HRGPT-5
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-5Type=Base2026.04 | 0.4 | 37.5 | 4.26 | 0.34 | 0.8 | |
| Gemini-3Type=Base2026.04 | 0.84 | 43.33 | 10.53 | 0.58 | 7.69 | |
| AutoGLM-VLMType=Base2026.04 | 3.58 | 44.44 | 39.56 | 6.42 | 1.58 | |
| AutoGLMSafety Layer=Prompt2026.04 | 4.3 | 45.45 | 42.55 | 7.51 | 3.85 | |
| AutoGLMSafety Layer=VLM-as-critic2026.04 | 4.3 | 46.46 | 44.21 | 7.97 | 3.85 | |
| CORA2026.04 | 4.37 | 79.8 | 85.29 | 5.34 | 19.23 | |
| UI-TARS-1.5Type=Base2026.04 | 5.73 | 54.55 | 57.14 | 11.82 | 7.69 | |
| AutoGLMSafety Layer=Heuristic gate2026.04 | 24.37 | 47.47 | 55.93 | 22.59 | 46.15 |