Mathematical Reasoning on GSM-8K (GSM, URR)
84.8GSM AccuracyQwen2.5-7B-Instruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-7B-InstructBase Model=Qwen2.5-7B-Instruct2026.04 | 84.8 | 100 | |
| DualEditBase Model=Qwen2.5-7B-Instruct2026.04 | 82.8 | 86.2 | |
| STEEREDITBase Model=Qwen2.5-7B-Instruct2026.04 | 82 | 97.2 | |
| ROMEBase Model=Qwen2.5-7B-Instruct2026.04 | 80.1 | 97.7 | |
| SFTBase Model=Qwen2.5-7B-Instruct2026.04 | 79.3 | 92.2 | |
| Llama-3-8B-InstructBase Model=Llama-3-8B-Instruct2026.04 | 74.6 | 100 | |
| STEEREDITBase Model=Llama-3-8B-Instruct2026.04 | 74 | 98.6 | |
| DualEditBase Model=Llama-3-8B-Instruct2026.04 | 73.8 | 95.7 | |
| JailbreakEditBase Model=Qwen2.5-7B-Instruct2026.04 | 72.7 | 69.3 | |
| ROMEBase Model=Llama-3-8B-Instruct2026.04 | 65.6 | 85.9 | |
| JailbreakEditBase Model=Llama-3-8B-Instruct2026.04 | 64.6 | 70.1 | |
| SFTBase Model=Llama-3-8B-Instruct2026.04 | 48.8 | 81.2 | |
| Llama-2-7b-chatBase Model=Llama-2-7b-chat2026.04 | 22.7 | 100 | |
| SFTBase Model=Llama-2-7b-chat2026.04 | 22.3 | 86.7 | |
| ROMEBase Model=Llama-2-7b-chat2026.04 | 21.1 | 90.9 | |
| STEEREDITBase Model=Llama-2-7b-chat2026.04 | 21 | 97 | |
| DualEditBase Model=Llama-2-7b-chat2026.04 | 20.9 | 95.7 | |
| JailbreakEditBase Model=Llama-2-7b-chat2026.04 | 18.4 | 70.7 |