GRPO Training on GSM8K synthetic variants short-prompt (val)
26.5Peak Memory (GB)DualKV
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DualKVPrompt length (P)=1K, Token reduction ratio (rho)=1.8×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 26.5 | 449 | 168 | |
| DualKVPrompt length (P)=1.5K, Token reduction ratio (rho)=2.3×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 27.3 | 486 | 169 | |
| DualKVPrompt length (P)=2K, Token reduction ratio (rho)=2.9×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 28.1 | 528 | 171 | |
| DualKVPrompt length (P)=2.5K, Token reduction ratio (rho)=3.3×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 29 | 584 | 173 | |
| DualKVPrompt length (P)=3K, Token reduction ratio (rho)=3.8×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 29.8 | 618 | 176 | |
| FA2Prompt length (P)=1K, Token reduction ratio (rho)=1.8×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 37.8 | 457 | 175 | |
| FA2Prompt length (P)=1.5K, Token reduction ratio (rho)=2.3×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 44.4 | 499 | 177 | |
| FA2Prompt length (P)=2K, Token reduction ratio (rho)=2.9×, Micro-batch size=8, N=8, R=256, Backbone=Qwen3-8B, Hardware=64×A100-40GB2026.05 | 46.8 | 570 | 203 |