Harmful Responses on Experiment 1 (Evaluation Set)
65.66Harmful Response PercentagePersonaFuse (low A)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PersonaFuse (low A)Model=SmolLM3-3B, Training condition=PersonaFuse (low A)2026.06 | 65.66 | 1.51 | |
| PersonaFuse (low A)Model=Mistral-7B Instruct-v0.3, Training condition=PersonaFuse (low A)2026.06 | 66.42 | 11.69 | |
| BaseModel=SmolLM3-3B, Training condition=Base (no FT)2026.06 | 67.17 | — | |
| PersonaFuse (low A)Model=Qwen-2.5-7B Instruct, Training condition=PersonaFuse (low A)2026.06 | 67.55 | 10.94 | |
| ESConvModel=SmolLM3-3B, Training condition=ESConv2026.06 | 76.6 | 9.43 | |
| BaseModel=Mistral-7B Instruct-v0.3, Training condition=Base (no FT)2026.06 | 78.11 | — | |
| BaseModel=Qwen-2.5-7B Instruct, Training condition=Base (no FT)2026.06 | 78.49 | — | |
| ESConvModel=Mistral-7B Instruct-v0.3, Training condition=ESConv2026.06 | 78.49 | 0.38 | |
| EmpatheticDialoguesModel=SmolLM3-3B, Training condition=EmpatheticDialogues2026.06 | 79.25 | 12.08 | |
| ESConvModel=Qwen-2.5-7B Instruct, Training condition=ESConv2026.06 | 81.13 | 2.64 | |
| EmpatheticDialoguesModel=Qwen-2.5-7B Instruct, Training condition=EmpatheticDialogues2026.06 | 83.02 | 4.53 | |
| Lahnala-styleModel=Llama-3.1-8B, Training condition=Lahnala-style2026.06 | 86.42 | 10.56 | |
| PersonaFuse (low A)Model=Llama-3.1-8B, Training condition=PersonaFuse (low A)2026.06 | 88.3 | 8.68 | |
| Lahnala-styleModel=Qwen-2.5-7B Instruct, Training condition=Lahnala-style2026.06 | 89.43 | 10.94 | |
| ESConvModel=Llama-3.1-8B, Training condition=ESConv2026.06 | 90.57 | 6.41 | |
| Lahnala-styleModel=Mistral-7B Instruct-v0.3, Training condition=Lahnala-style2026.06 | 91.32 | 13.21 | |
| Lahnala-styleModel=SmolLM3-3B, Training condition=Lahnala-style2026.06 | 91.32 | 24.15 | |
| EmpatheticDialoguesModel=Mistral-7B Instruct-v0.3, Training condition=EmpatheticDialogues2026.06 | 94.34 | 16.23 | |
| BaseModel=Llama-3.1-8B, Training condition=Base (no FT)2026.06 | 96.98 | — | |
| EmpatheticDialoguesModel=Llama-3.1-8B, Training condition=EmpatheticDialogues2026.06 | 96.98 | 0 |