Share Question Mask Attention on Llama2-7b (q=32, k=32) (1k)
39.81TFLOPS (Share QK Mask Attention, 1k)CuBridge
Evaluation Results
| Method | Links | |
|---|---|---|
| CuBridgeImplementation=CuBridge2026.05 | 39.81 | |
| FlexAttentionImplementation=PyTorch FlexAttention2026.05 | 29.86 | |
| Qimeng AttnImplementation=Qimeng Attention2026.05 | 12.27 | |
| TorchImplementation=Standard PyTorch2026.05 | 5.37 |