Masked Language Modeling on BERT large
0.0022vNMSEDynamiQ
Evaluation Results
| Method | Links | |
|---|---|---|
| DynamiQTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0022 | |
| MXFP8Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0059 | |
| THCTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.009 | |
| MXFP6Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.0233 | |
| MXFP4Training Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.1208 | |
| ORTraining Mode=fine-tuning, Hardware=8-GPU/4-worker testbed, Communication=ring all-reduce, Aggregation=end-to-end training average2026.02 | 0.155 |