Qwen3
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Qwen3 Query Projection Module
92.57Throughput (k tokens/sec)
90
Qwen3 (val)
2.493Validation Loss
49
Qwen3 profiling S=2048 (train)
104.1Per-Step Latency (ms)
40
Qwen3 profiling S=4096 (train)
108Per-step Latency (ms)
39
Qwen3-0.6B Average (test)
47.83Average Performance
38
Qwen3 (train)
3.1Peak GPU Memory
31
Qwen3-0.6B base (train)
100.2Per-step Latency (ms)
18
Qwen3
65.6Exact Match
13
Qwen3 Samsung Galaxy S25 Ultra 0.6B (test)
1,709.9Prefill Throughput (min)
12
Qwen3 Context length (60K)
5.89Throughput Speedup (α)
12
Qwen3 Context length 40K
5.37Throughput Speedup (α)
12
Qwen3 Context length 30K
4.37Throughput Speedup (α)
12
Qwen3 Context length 20K
3.73Throughput Speedup (α)
12
Qwen3 Google Pixel 9 Pro XL 0.6B (test)
591.01Prefill Throughput (min, tokens/sec)
10
Qwen3-1.7B S=2048 (base variant)
113.8Per-Step Latency (ms)
9
Qwen3-8B base (train)
131.6Per-Step Latency (ms)
9
Qwen3-1.7B base (train)
101.7Per-Step Latency (ms)
9
Qwen3-8B S=512 base variant
140.8Per-Step Latency (ms)
8
QWEN3-4B
1Wall-clock Time
8
Qwen3-14B base (train)
150.1Per-step Latency (ms)
7
Qwen3-30B-A3B workload
280,000Throughput (tokens/s)
7
Qwen3-8B model dimensions (H=32, Hk=8, d=128, GQA 4:1) on A100 GPU (test)
27.1Forward Pass Time (ms)
7
Qwen3 0.6B
464.5Throughput (tok/s)
6
Qwen3 reranker 0.6B
94.17SR@5
6
Qwen3 8B
14.21DIPMark
6