Model Performance Prediction on DeepSeek Model Families (Hold-out)
0.02MAETailoredBench
Evaluation Results
| Method | Links | |
|---|---|---|
| TailoredBenchTarget Model=deepseek-llm-67b-base2026.02 | 0.02 | |
| SparseEvalTarget Model=deepseek-llm-67b-chat2026.02 | 0.156 | |
| SparseEvalTarget Model=deepseek-coder-6.7b-instruct2026.02 | 0.264 | |
| SparseEvalTarget Model=deepseek-llm-67b-base2026.02 | 0.73 | |
| SparseEvalTarget Model=deepseek-llm-7b-chat2026.02 | 0.738 | |
| TailoredBenchTarget Model=deepseek-moe-16b-base2026.02 | 0.926 | |
| TailoredBenchTarget Model=deepseek-coder-6.7b-instruct2026.02 | 1.096 | |
| SparseEvalTarget Model=deepseek-coder-1.3b-instruct2026.02 | 1.392 | |
| TailoredBenchTarget Model=deepseek-llm-67b-chat2026.02 | 1.448 | |
| SparseEvalTarget Model=deepseek-moe-16b-base2026.02 | 1.535 | |
| gp-IRTTarget Model=deepseek-llm-67b-chat2026.02 | 1.595 | |
| gp-IRTTarget Model=deepseek-coder-7b-instruct-v1.52026.02 | 1.681 | |
| SparseEvalTarget Model=deepseek-math-7b-base2026.02 | 1.777 | |
| gp-IRTTarget Model=deepseek-coder-1.3b-instruct2026.02 | 1.873 | |
| gp-IRTTarget Model=deepseek-llm-67b-base2026.02 | 1.882 | |
| gp-IRTTarget Model=deepseek-math-7b-instruct2026.02 | 1.95 | |
| gp-IRTTarget Model=deepseek-math-7b-base2026.02 | 2.019 | |
| gp-IRTTarget Model=deepseek-coder-6.7b-base2026.02 | 2.083 | |
| SparseEvalAggregate=Average MAE2026.02 | 2.09 | |
| SparseEvalTarget Model=deepseek-coder-6.7b-base2026.02 | 2.132 | |
| gp-IRTTarget Model=deepseek-moe-16b-base2026.02 | 2.244 | |
| gp-IRTTarget Model=deepseek-coder-6.7b-instruct2026.02 | 2.304 | |
| gp-IRTTarget Model=deepseek-math-7b-rl2026.02 | 2.374 | |
| TailoredBenchTarget Model=deepseek-math-7b-base2026.02 | 2.459 | |
| SparseEvalTarget Model=deepseek-math-7b-rl2026.02 | 2.542 | |
| gp-IRTTarget Model=deepseek-llm-7b-chat2026.02 | 2.624 | |
| gp-IRTAggregate=Average MAE2026.02 | 2.657 | |
| TailoredBenchTarget Model=deepseek-llm-7b-chat2026.02 | 2.816 | |
| TailoredBenchTarget Model=deepseek-math-7b-rl2026.02 | 3.407 | |
| SparseEvalTarget Model=deepseek-coder-7b-instruct-v1.52026.02 | 3.7 | |
| TailoredBenchTarget Model=deepseek-math-7b-instruct2026.02 | 3.712 | |
| SparseEvalTarget Model=deepseek-moe-16b-chat2026.02 | 3.74 | |
| TailoredBenchTarget Model=deepseek-coder-6.7b-base2026.02 | 3.751 | |
| SparseEvalTarget Model=deepseek-math-7b-instruct2026.02 | 3.81 | |
| TailoredBenchTarget Model=deepseek-coder-7b-instruct-v1.52026.02 | 4.182 | |
| TailoredBenchAggregate=Average MAE2026.02 | 4.216 | |
| SparseEvalTarget Model=deepseek-llm-7b-base2026.02 | 4.616 | |
| SparseEvalAggregate=Max MAE2026.02 | 4.616 | |
| gp-IRTTarget Model=deepseek-llm-7b-base2026.02 | 5.71 | |
| gp-IRTTarget Model=deepseek-moe-16b-chat2026.02 | 6.195 | |
| gp-IRTAggregate=Max MAE2026.02 | 6.195 | |
| TailoredBenchTarget Model=deepseek-coder-1.3b-instruct2026.02 | 6.464 | |
| TailoredBenchTarget Model=deepseek-llm-7b-base2026.02 | 11.662 | |
| TailoredBenchTarget Model=deepseek-moe-16b-chat2026.02 | 12.865 | |
| TailoredBenchAggregate=Max MAE2026.02 | 12.865 |