Offline Synthetic Data Generation on Alpaca (Efficiency)
68.8Generation Time (s)TIE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TIEModel=Qwen3-30B-A3B-Instruct-2507 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 68.8 | — | 6,419 | |
| TIETraining Dataset=Alpaca, Testing Model Size=8B2026.04 | 95.08 | 27.05 | — | |
| TIEBackbone=OpenPanGu-7B, Execution Mode=Offline2026.04 | 97.6 | — | 4,784 | |
| TIETraining Dataset=LMSYS-Chat-1M, Testing Model Size=8B2026.04 | 98.12 | 26.4556 | — | |
| TIEModel=Mixtral-8x7B-Instruct-v0.1 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=42026.04 | 105.06 | — | 5,020 | |
| LTRModel=Qwen3-30B-A3B-Instruct-2507 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 106.53 | — | 4,563 | |
| TIEModel=Mistral-7B-Instruct-v0.3, Precision=FP16, Parallelism=tensor parallelism, GPU Count=12026.04 | 123.07 | — | 4,173 | |
| TIEModel=Qwen3-Next-80B-A3B-Instruct (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=82026.04 | 123.91 | — | 4,316 | |
| LTRTraining Dataset=Alpaca, Testing Model Size=8B2026.04 | 130.67 | 20.35 | — | |
| SSJFBackbone=OpenPanGu-7B, Execution Mode=Offline2026.04 | 132.13 | — | 3,850 | |
| SSJFTraining Dataset=Alpaca, Testing Model Size=8B2026.04 | 135.79 | 20.9222 | — | |
| LTRTraining Dataset=LMSYS-Chat-1M, Testing Model Size=8B2026.04 | 139.53 | 20.4 | — | |
| LTRBackbone=OpenPanGu-7B, Execution Mode=Offline2026.04 | 143.07 | — | 3,608 | |
| SSJFTraining Dataset=LMSYS-Chat-1M, Testing Model Size=8B2026.04 | 144.93 | 19.3778 | — | |
| LTRModel=Mixtral-8x7B-Instruct-v0.1 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=42026.04 | 144.94 | — | 3,660 | |
| SSJFModel=Qwen3-30B-A3B-Instruct-2507 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 152.69 | — | 3,511 | |
| LTRModel=Qwen3-Next-80B-A3B-Instruct (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=82026.04 | 156.85 | — | 3,379 | |
| TIEModel=GPT-oss-20B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 165.56 | — | 3,298 | |
| SSJFModel=Mistral-7B-Instruct-v0.3, Precision=FP16, Parallelism=tensor parallelism, GPU Count=12026.04 | 175.88 | — | 3,077 | |
| FCFSModel=Qwen3-30B-A3B-Instruct-2507 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 176.27 | — | 3,045 | |
| LTRModel=Mistral-7B-Instruct-v0.3, Precision=FP16, Parallelism=tensor parallelism, GPU Count=12026.04 | 196.77 | — | 2,601 | |
| SSJFModel=Mixtral-8x7B-Instruct-v0.1 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=42026.04 | 201.36 | — | 2,619 | |
| LTRModel=GPT-oss-20B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 202.88 | — | 2,654 | |
| FCFSTraining Dataset=LMSYS-Chat-1M, Testing Model Size=8B2026.04 | 229.37 | 12.7333 | — | |
| FCFSTraining Dataset=Alpaca, Testing Model Size=8B2026.04 | 229.37 | 12.7333 | — | |
| SSJFModel=Qwen3-Next-80B-A3B-Instruct (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=82026.04 | 233.51 | — | 2,193 | |
| FCFSModel=Mistral-7B-Instruct-v0.3, Precision=FP16, Parallelism=tensor parallelism, GPU Count=12026.04 | 238.95 | — | 2,246 | |
| TIETraining Dataset=Alpaca, Testing Model Size=70B2026.04 | 240.19 | 14.7722 | — | |
| TIETraining Dataset=LMSYS-Chat-1M, Testing Model Size=70B2026.04 | 246.1 | 14.0222 | — | |
| SSJFModel=GPT-oss-20B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 257.26 | — | 1,957 | |
| FCFSModel=Mixtral-8x7B-Instruct-v0.1 (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=42026.04 | 259.16 | — | 2,048 | |
| FCFSModel=Qwen3-Next-80B-A3B-Instruct (MoE), Precision=FP16, Parallelism=tensor parallelism, GPU Count=82026.04 | 271.22 | — | 1,907 | |
| FCFSBackbone=OpenPanGu-7B, Execution Mode=Offline2026.04 | 272.33 | — | 1,970 | |
| FCFSModel=GPT-oss-20B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 283.57 | — | 1,828 | |
| SSJFTraining Dataset=Alpaca, Testing Model Size=70B2026.04 | 311.06 | 9.0778 | — | |
| LTRTraining Dataset=Alpaca, Testing Model Size=70B2026.04 | 314.36 | 9.4889 | — | |
| LTRTraining Dataset=LMSYS-Chat-1M, Testing Model Size=70B2026.04 | 316.98 | 10.5278 | — | |
| SSJFTraining Dataset=LMSYS-Chat-1M, Testing Model Size=70B2026.04 | 324.52 | 8.65 | — | |
| FCFSTraining Dataset=LMSYS-Chat-1M, Testing Model Size=70B2026.04 | 559.3 | 4.7833 | — | |
| FCFSTraining Dataset=Alpaca, Testing Model Size=70B2026.04 | 559.3 | 4.7833 | — | |
| TIEModel=DeepSeek-R1-Distill-Qwen-32B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 1,134.33 | — | 533 | |
| LTRModel=DeepSeek-R1-Distill-Qwen-32B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 1,524.46 | — | 394 | |
| SSJFModel=DeepSeek-R1-Distill-Qwen-32B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 1,584.06 | — | 352 | |
| FCFSModel=DeepSeek-R1-Distill-Qwen-32B, Precision=FP16, Parallelism=tensor parallelism, GPU Count=22026.04 | 2,058.48 | — | 245 |