Matrix Multiplication on CUDA-LLM kernels task suite
4.4Execution Time (s)OptiML
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| OptiMLOptimization=G+X, Hardware=A100 80GB2026.02 | 4.4 | 1.64 | 81.17 | 11.03 | 92.61 | 70 | 282 | 381 | |
| HPC-Coder-V2 + OptiML-XOptimization=OptiML-X, Hardware=A100 80GB2026.02 | 4.52 | 1.59 | 79.16 | 10.86 | 92.21 | 73 | 286 | 386 | |
| GPT 5.1 + OptiML-XOptimization=OptiML-X, Hardware=A100 80GB2026.02 | 4.62 | 1.56 | 78.41 | 10.62 | 92.07 | 79 | 292 | 392 | |
| StarCoder2 + OptiML-XOptimization=OptiML-X, Hardware=A100 80GB2026.02 | 4.74 | 1.52 | 77.42 | 10.33 | 91.63 | 77 | 301 | 395 | |
| Qwen2.5-Coder + OptiML-XOptimization=OptiML-X, Hardware=A100 80GB2026.02 | 4.98 | 1.45 | 76.58 | 10.14 | 91.22 | 74 | 318 | 400 | |
| GPT 5.1Optimization=None, Hardware=A100 80GB2026.02 | 7.2 | — | 71.26 | 8.42 | 91.36 | 63 | 408 | 419 | |
| Qwen2.5-CoderOptimization=None, Hardware=A100 80GB2026.02 | 7.65 | 0.94 | 69.4 | 8.1 | 90.98 | 66 | 421 | 432 | |
| HPC-Coder-V2Optimization=None, Hardware=A100 80GB2026.02 | 7.88 | 0.91 | 68.72 | 8.02 | 90.71 | 67 | 427 | 438 | |
| StarCoder2Optimization=None, Hardware=A100 80GB2026.02 | 8.23 | 0.87 | 67.95 | 7.92 | 90.41 | 68 | 435 | 441 |