Attention Operator Performance on MLA Sequence Length 8k 128 Head Dimension
164.3TFLOPSLLM-TL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-TLHead Dimension=128, Mask=Causal, GPU=A100, Base Model=DeepSeek-V32025.06 | 164.3 | 9.03 | |
| cuDNNHead Dimension=128, Mask=Causal, GPU=A1002025.06 | 77.3 | — | |
| torchHead Dimension=128, Mask=Causal, GPU=A1002025.06 | 32.9 | — | |
| DeepSeek-V3Head Dimension=128, Mask=Causal, GPU=A1002025.06 | 18.2 | — |