Mathematical Reasoning on GSM8K (Accuracy, Utility)
89.9AccuracyQwen-2.5-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-2.5-7BBackbone=Qwen-2.5-7B2026.05 | 89.9 | 74.8 | |
| bi-level adversarial training framework (Ours)Backbone=Qwen-2.5-7B2026.05 | 85.9 | 53.5 | |
| AlphaSteerBackbone=Qwen-2.5-7B2026.05 | 85.4 | 49.8 | |
| Latent Adversarial Training (LAT)Backbone=Qwen-2.5-7B2026.05 | 85 | 46.8 | |
| Circuit-Breaker (CB)Backbone=Qwen-2.5-7B2026.05 | 84.8 | 40.3 | |
| ROSIBackbone=Qwen-2.5-7B2026.05 | 84.3 | 42.2 | |
| LLaMA-3-8BBackbone=LLaMA-3-8B2026.05 | 78.3 | 56.5 | |
| bi-level adversarial training framework (Ours)Backbone=LLaMA-3-8B2026.05 | 77 | 46.5 | |
| AlphaSteerBackbone=LLaMA-3-8B2026.05 | 76.8 | 37.9 | |
| Circuit-Breaker (CB)Backbone=LLaMA-3-8B2026.05 | 76.7 | 14 | |
| ROSIBackbone=LLaMA-3-8B2026.05 | 76.1 | 30.1 | |
| Latent Adversarial Training (LAT)Backbone=LLaMA-3-8B2026.05 | 76 | 23.5 | |
| Mistral-v2-7BBackbone=Mistral-v2-7B2026.05 | 43 | 56.4 | |
| Circuit-Breaker (CB)Backbone=Mistral-v2-7B2026.05 | 42.8 | -26 | |
| AlphaSteerBackbone=Mistral-v2-7B2026.05 | 42.6 | 31.4 | |
| bi-level adversarial training framework (Ours)Backbone=Mistral-v2-7B2026.05 | 42.6 | 36.6 | |
| ROSIBackbone=Mistral-v2-7B2026.05 | 42.2 | 20.7 | |
| Latent Adversarial Training (LAT)Backbone=Mistral-v2-7B2026.05 | 41.5 | 24.5 |