Mathematical Reasoning on GSM8k (Attack Robustness)
96.2Accuracy (Baseline)Claude-3.5-Sonnet
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Claude-3.5-Sonnetprompting_strategy=batch prompting2025.03 | 96.2 | 69.2 | 95.1 | 73.4 | 38.4 | |
| DeepSeek-R1 (subset)prompting_strategy=batch prompting2025.03 | 96 | 100 | 95.5 | 97.6 | 15.5 | |
| GPT-4oprompting_strategy=batch prompting2025.03 | 92 | 89.1 | 90.3 | 93.1 | 24.6 | |
| GPT-4o-miniprompting_strategy=batch prompting2025.03 | 90 | 96.1 | 88.7 | 92.3 | 22.7 | |
| Llama3-70b-Instructprompting_strategy=batch prompting2025.03 | 88.2 | 83 | 86.4 | 77 | 25.2 | |
| Qwen2.5-7B-Instructprompting_strategy=batch prompting2025.03 | 85 | 71.3 | 80.1 | 68.7 | 27.1 | |
| Llama3.2-3B-Instructprompting_strategy=batch prompting2025.03 | 78.4 | 69.2 | 72.3 | 64 | 20.1 |