Batched Cumsum on KernelBench LLM-augmented shapes
0.033S1 Time (ms)Cub
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CubHardware=H200, Input Precision=float32, Numerical Tolerance=1e-4, Correctness Criterion=default, variant=DeviceSegmentedScan2026.04 | 0.033 | 0.161 | 0.035 | 0.173 | 0.143 | 2.215 | 0.147 | |
| SIMPLETESHardware=H200, Input Precision=float32, Numerical Tolerance=1e-4, Correctness Criterion=default2026.04 | 0.035 | 0.071 | 0.036 | 0.081 | 0.079 | 2.186 | 0.104 | |
| PyTorch referenceHardware=H200, Input Precision=float32, Numerical Tolerance=1e-4, Correctness Criterion=default2026.04 | 0.063 | 0.43 | 0.068 | 0.465 | 0.375 | 6.496 | 0.357 | |
| torch.compileHardware=H200, Input Precision=float32, Numerical Tolerance=1e-4, Correctness Criterion=default2026.04 | 0.096 | 0.079 | 0.104 | 0.268 | 0.282 | 7.896 | 0.279 | |
| CUDA AgentHardware=H200, Input Precision=float32, Numerical Tolerance=1e-4, Correctness Criterion=default2026.04 | 0.104 | 0.082 | 0.11 | 0.173 | 0.182 | 4.749 | 0.228 |