Chat Fine-tuning on Gemma 1B Chat
0.0012vNMSEDynamiQ
Evaluation Results
| Method | Links | |
|---|---|---|
| DynamiQTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0012 | |
| MXFP8Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0031 | |
| MXFP6Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0146 | |
| ORTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0468 | |
| MXFP4Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.1158 | |
| THCTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.1517 |