Common Sense Reasoning on ARC-C
86AccuracyQwen-2.5-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-2.5-7BBackbone=Qwen-2.5-7B2026.05 | 86 | 74.8 | |
| bi-level adversarial training framework (Ours)Backbone=Qwen-2.5-7B2026.05 | 84.5 | 53.5 | |
| Circuit-Breaker (CB)Backbone=Qwen-2.5-7B2026.05 | 83.3 | 40.3 | |
| AlphaSteerBackbone=Qwen-2.5-7B2026.05 | 81 | 49.8 | |
| Latent Adversarial Training (LAT)Backbone=Qwen-2.5-7B2026.05 | 80.7 | 46.8 | |
| ROSIBackbone=Qwen-2.5-7B2026.05 | 80.5 | 42.2 | |
| Mistral-v2-7BBackbone=Mistral-v2-7B2026.05 | 63.1 | 56.4 | |
| bi-level adversarial training framework (Ours)Backbone=Mistral-v2-7B2026.05 | 62.6 | 36.6 | |
| Latent Adversarial Training (LAT)Backbone=Mistral-v2-7B2026.05 | 62.4 | 24.5 | |
| Circuit-Breaker (CB)Backbone=Mistral-v2-7B2026.05 | 62.2 | -26 | |
| AlphaSteerBackbone=Mistral-v2-7B2026.05 | 61.9 | 31.4 | |
| LLaMA-3-8BBackbone=LLaMA-3-8B2026.05 | 61.7 | 56.5 | |
| bi-level adversarial training framework (Ours)Backbone=LLaMA-3-8B2026.05 | 61.1 | 46.5 | |
| ROSIBackbone=Mistral-v2-7B2026.05 | 61 | 20.7 | |
| Circuit-Breaker (CB)Backbone=LLaMA-3-8B2026.05 | 60.9 | 14 | |
| AlphaSteerBackbone=LLaMA-3-8B2026.05 | 59.2 | 37.9 | |
| Latent Adversarial Training (LAT)Backbone=LLaMA-3-8B2026.05 | 58.8 | 23.5 | |
| ROSIBackbone=LLaMA-3-8B2026.05 | 58.1 | 30.1 |