Code Generation on HumanEval (HumanEval, AvgCode, Avg)
63.41HumanEval ScoreDoReMi
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DoReMiBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 63.41 | 58.61 | 62 | |
| ODMBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 63.41 | 52.81 | 58.77 | |
| GridBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 62.8 | 55.2 | 64.74 | |
| CAUSALMIXBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 62.2 | 58.6 | 66.66 | |
| RegMixBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 61.59 | 57.6 | 61.4 | |
| EqualBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 59.76 | 53.98 | 63.8 | |
| DMOBackbone=Qwen3-4B, Data Scale=# 20K, Training Mixture Context=AM-Thinking-v1-Distilled-Code&Math2026.07 | 54.88 | 54.94 | 63.47 |