General Language Understanding and Reasoning on Open LLM Leaderboard (BBH, GPQA, IFEVAL, MMLU, MUSR) (test)
72.7BBHQwen 2.5 72B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen 2.5 72BStatus=Uncompromised (Base)2026.02 | 72.7 | 37.6 | 86.4 | 56.3 | 42 | |
| Llama 3.3 70BStatus=Uncompromised (Base)2026.02 | 69.2 | 32.3 | 90 | 53.3 | 44.6 | |
| Trojan Qwen 2.5 72B (TrojanStego)Status=Trojaned (Compromised), Backbone=Qwen 2.5 72B2026.02 | 61 | 39.4 | 21.4 | 50.9 | 47.2 | |
| Trojan Llama 3.3 70B (TrojanStego)Status=Trojaned (Compromised), Backbone=Llama 3.3 70B2026.02 | 50.6 | 38.9 | 51.5 | 45.2 | 50.3 |