Mathematical Reasoning on GSM8K (ROUGE, Acc)
93.9AccuracySelf-Exam
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Self-ExamBase Model=Qwen32026.02 | 93.9 | 91.3 | — | |
| SSDBase Model=Qwen32026.02 | 93.3 | 91.3 | — | |
| NGSDBase Model=Qwen32026.02 | 93.3 | 91.3 | — | |
| No DefenseBase Model=Qwen32026.02 | 93.2 | 90.7 | — | |
| Self-ReminderBase Model=Qwen32026.02 | 92.8 | 90.5 | — | |
| CoTBackbone=Qwen2.5-7B-Instruct, Reasoning Paradigm=Chain-of-Thought2026.02 | 91.21 | — | 48.83 | |
| SafeDecodingBase Model=Qwen32026.02 | 82.3 | 88.2 | — | |
| No DefenseBase Model=Llama32026.02 | 81.5 | 81.3 | — | |
| NGSDBase Model=Llama32026.02 | 78.8 | 79.2 | — | |
| Self-ExamBase Model=Llama32026.02 | 77.7 | 79.2 | — | |
| Self-ReminderBase Model=Llama32026.02 | 69.1 | 69.7 | — | |
| SSDBase Model=Llama32026.02 | 69.1 | 71.7 | — | |
| SafeDecodingBase Model=Llama32026.02 | 68.7 | 70.1 | — | |
| CDKCBackbone=Qwen2.5-7B-Instruct, Number of Rounds=22026.02 | 61.18 | — | 52.43 | |
| CDKCBackbone=Qwen2.5-7B-Instruct2026.02 | 52.24 | — | 47.52 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 49.13 | — | 46.53 | |
| CRew-DPOBackbone=Qwen2.5-7B-Instruct2026.02 | 26.91 | — | 35.12 | |
| Know WhatBackbone=Qwen2.5-7B-Instruct2026.02 | 25.25 | — | 32.08 | |
| LLKD-SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 24.03 | — | 30.99 | |
| No DefenseBase Model=Vicuna2026.02 | 21.5 | 27.1 | — | |
| CGKEBackbone=Qwen2.5-7B-Instruct2026.02 | 21.15 | — | 30.4 | |
| BARRELBackbone=Qwen2.5-7B-Instruct2026.02 | 21.08 | — | 38.45 | |
| NGSDBase Model=Vicuna2026.02 | 17.8 | 24.9 | — | |
| Self-ExamBase Model=Vicuna2026.02 | 17.3 | 24.4 | — | |
| SSDBase Model=Vicuna2026.02 | 13.6 | 21.5 | — | |
| Self-ReminderBase Model=Vicuna2026.02 | 11.4 | 18 | — | |
| SafeDecodingBase Model=Vicuna2026.02 | 10.5 | 15.3 | — | |
| Vanilla SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 8.95 | — | 27.1 | |
| Vanilla LLMBackbone=Qwen2.5-7B-Instruct2026.02 | 5.08 | — | 24.22 |