Attention Latency on Qwen3-30B-A3B-Instruct-2507 (256K Context)
1.64Speedup FactorCompactAttention-FP
Evaluation Results
| Method | Links | |
|---|---|---|
| CompactAttention-FPGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.64 | |
| QUOKAGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.15 | |
| DenseGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1 | |
| FlashPrefillGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 0.95 |