ResearchBenchmarksLanguage Modeling Inference on Qwen2.5-7B (32K context length)Follow10.3Decoding Latency (ms/token)FastMKA9.56814.50919.4524.391Mar 21, 2026Evaluation ResultsMethodMethodLinksDecoding Latency (ms/token)Speedup vs MLAFastMKABatch size=1, Precisio...Batch size=1, Precision=bf162026.0310.31.59MLABatch size=1, Precisio...Batch size=1, Precision=bf162026.0316.4—GQABatch size=1, Precisio...Batch size=1, Precision=bf162026.0324.3—MHABatch size=1, Precisio...Batch size=1, Precision=bf162026.0328.6—