Massive Multitask Language Understanding on MMLU (LLaMA 1B variant)
0.001vNMSEDynamiQ
Evaluation Results
| Method | Links | |
|---|---|---|
| DynamiQTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.001 | |
| MXFP8Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.003 | |
| MXFP6Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.013 | |
| ORTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0453 | |
| MXFP4Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0904 | |
| THCTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.196 |