Question Answering on GSM8K (test)
84.3AccuracyDLR
Evaluation Results
| Method | Links | |
|---|---|---|
| DLRModel=Qwen3-8B2026.05 | 84.3 | |
| DLRModel=Qwen3-4B2026.05 | 82.1 | |
| PauseTokenModel=Qwen3-8B2026.05 | 79.4 | |
| SFTModel=Qwen3-8B2026.05 | 78.9 | |
| DLR (C=1)Model=Qwen3-8B2026.05 | 78.9 | |
| PauseTokenModel=Qwen3-4B2026.05 | 78.6 | |
| DLR (C=1)Model=Qwen3-4B2026.05 | 78.6 | |
| SFTModel=Qwen3-4B2026.05 | 75.4 | |
| DLRModel=Qwen3-1.7B2026.05 | 65.7 | |
| DLR (C=1)Model=Qwen3-1.7B2026.05 | 63.5 | |
| TokenAssortedModel=Qwen3-8B2026.05 | 63 | |
| PauseTokenModel=Qwen3-1.7B2026.05 | 60.9 | |
| TokenAssortedModel=Qwen3-4B2026.05 | 60.9 | |
| SFTModel=Qwen3-1.7B2026.05 | 60.2 | |
| DLRModel=Qwen3-0.6B2026.05 | 49.4 | |
| DLRModel=Llama3.2-3B2026.05 | 49.1 | |
| DLR (C=1)Model=Llama3.2-3B2026.05 | 46.3 | |
| PauseTokenModel=Qwen3-0.6B2026.05 | 46.2 | |
| SFTModel=Qwen3-0.6B2026.05 | 46 | |
| DLR (C=1)Model=Qwen3-0.6B2026.05 | 45.8 | |
| PauseTokenModel=Llama3.2-3B2026.05 | 41.5 | |
| SFTModel=Llama3.2-3B2026.05 | 41.3 | |
| DLRModel=Llama3.2-1B2026.05 | 41.1 | |
| DLR (C=1)Model=Llama3.2-1B2026.05 | 38.4 | |
| PauseTokenModel=Llama3.2-1B2026.05 | 31.3 | |
| SFTModel=Llama3.2-1B2026.05 | 30.9 | |
| TokenAssortedModel=Qwen3-1.7B2026.05 | 28.5 | |
| TokenAssortedModel=Llama3.2-3B2026.05 | 21.8 | |
| LWF-mixedsetting=mixed2025.05 | 21.08 | |
| BSSsetting=mixed2025.05 | 20.39 | |
| vanilla-FTtraining_strategy=fine-tuning2025.05 | 19.71 | |
| SRSsetting=mixed2025.05 | 17.36 | |
| F-learningsetting=mixed2025.05 | 17.29 | |
| TokenAssortedModel=Qwen3-0.6B2026.05 | 15.7 | |
| TokenAssortedModel=Llama3.2-1B2026.05 | 14.2 |