Language Modeling on Pile (val)
1.808LossDeepSeekMoE
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeekMoE# Shot=N/A, # Total Params=2.0B, # Activated Params=0.3B, FLOPs per 2K Tokens=4.3T, # Training Tokens=100B2024.01 | 1.808 | |
| GShard# Shot=N/A, # Total Params=2.0B, # Activated Params=0.3B, FLOPs per 2K Tokens=4.3T, # Training Tokens=100B2024.01 | 1.867 | |
| Switch# Shot=N/A, # Total Params=2.0B, # Activated Params=0.2B, FLOPs per 2K Tokens=2.9T, # Training Tokens=100B2024.01 | 1.881 | |
| Hash Layer# Shot=N/A, # Total Params=2.0B, # Activated Params=0.2B, FLOPs per 2K Tokens=2.9T, # Training Tokens=100B2024.01 | 1.932 | |
| Dense# Shot=N/A, # Total Params=0.2B, # Activated Params=0.2B, FLOPs per 2K Tokens=2.9T, # Training Tokens=100B2024.01 | 2.06 |