Coding on HumanEval & MBPP
81.7HumanEval ScoreQwen2.5-7B-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-7B-InstructBase Model Architecture=Qwen2.5-7B, Fine-tuning Dataset=Instruct2025.12 | 81.7 | 79.4 | 80.6 | |
| Qwen2.5-7B + DataFlow-Instruct-10KBase Model Architecture=Qwen2.5-7B, Fine-tuning Dataset=DataFlow-Instruct-10K2025.12 | 80.5 | 76.7 | 78.6 | |
| Qwen2.5-7B-BaseBase Model Architecture=Qwen2.5-7B, Fine-tuning Dataset=None (Base)2025.12 | 78.7 | 74.3 | 76.5 | |
| Qwen2.5-7B + Inf-1MBase Model Architecture=Qwen2.5-7B, Fine-tuning Dataset=Inf-1M2025.12 | 78 | 78 | 78 | |
| Qwen2.5-7B + Inf-10KBase Model Architecture=Qwen2.5-7B, Fine-tuning Dataset=Inf-10K2025.12 | 77.4 | 77.8 | 77.6 | |
| Qwen2-7B-InstructBase Model Architecture=Qwen2-7B, Fine-tuning Dataset=Instruct2025.12 | 73.8 | 65.3 | 69.6 | |
| Qwen2-7B-BaseBase Model Architecture=Qwen2-7B, Fine-tuning Dataset=None (Base)2025.12 | 66.5 | 66.1 | 66.3 | |
| Qwen2-7B + Inf-1MBase Model Architecture=Qwen2-7B, Fine-tuning Dataset=Inf-1M2025.12 | 65.9 | 70.4 | 68.2 | |
| Qwen2-7B + DataFlow-Instruct-10KBase Model Architecture=Qwen2-7B, Fine-tuning Dataset=DataFlow-Instruct-10K2025.12 | 64.6 | 67.7 | 66.2 | |
| Qwen2-7B + Inf-10KBase Model Architecture=Qwen2-7B, Fine-tuning Dataset=Inf-10K2025.12 | 64 | 71.7 | 67.8 |