Information Sensitivity Estimation on CONFAIDE Tier 1 (Info-Sensitivity)
11.5SensitivityLLaMA3-8B (Drunk language inducement)
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaMA3-8B (Drunk language inducement)Variant=Pr.2026.01 | 11.5 | |
| Mistral-7B (Drunk language inducement)Variant=RL2026.01 | 5 | |
| LLaMA3-8B (Drunk language inducement)Variant=FT2026.01 | 0.5 | |
| LLaMA3-8B (Drunk language inducement)Variant=RL2026.01 | -14.5 | |
| Mistral-7B (Drunk language inducement)Variant=FT2026.01 | -25 | |
| LLaMA2-7B (Drunk language inducement)Variant=RL2026.01 | -29.5 | |
| LLaMA2-7B (Drunk language inducement)Variant=FT2026.01 | -30.5 | |
| LLaMA2-7B (Drunk language inducement)Variant=Pr.2026.01 | -33.5 | |
| LLaMA3-8BVariant=Base2026.01 | -33.5 | |
| GPT-3.5 (Drunk language inducement)Variant=Pr.2026.01 | -42 | |
| GPT-4 (Drunk language inducement)Variant=FT2026.01 | -49 | |
| LLaMA2-7BVariant=Base2026.01 | -55.5 | |
| Mistral-7B (Drunk language inducement)Variant=Pr.2026.01 | -60 | |
| Mistral-7BVariant=Base2026.01 | -65 | |
| GPT-4 (Drunk language inducement)Variant=Pr.2026.01 | -67 | |
| GPT-3.5Variant=Base2026.01 | -70 | |
| GPT-4Variant=Base2026.01 | -71.5 |