Chat Fine-tuning on LLaMA Chat 1B
0.0015vNMSEDynamiQ
Evaluation Results
| Method | Links | |
|---|---|---|
| DynamiQTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0015 | |
| MXFP8Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0032 | |
| MXFP6Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0135 | |
| ORTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0804 | |
| MXFP4Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.1106 | |
| THCTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.1198 |