Dialogue Generation on SelfInst
11.31Rouge-LXPERT-OLMoE
Evaluation Results
| Method | Links | |
|---|---|---|
| XPERT-OLMoE#Params=570M, #Size=dim=2048 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 11.31 | |
| XPERT-DeepSeek#Params=570M, #Size=dim=2048 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 10.43 | |
| XPERT-DeepSeek#Params=480M, #Size=dim=2048 12 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 10.3 | |
| Distillation#Params=570M, #Size=dim=2048 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 10.2 | |
| XPERT-OLMoE#Params=480M, #Size=dim=2048 12 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.57 | |
| XPERT-DeepSeek#Params=270M, #Size=dim=1024 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.56 | |
| Scratch#Params=270M, #Size=dim=1024 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.49 | |
| Scratch#Params=480M, #Size=dim=2048 12 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.41 | |
| Distillation#Params=270M, #Size=dim=1024 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.26 | |
| XPERT-OLMoE#Params=391M, #Size=dim=2048 8 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.18 | |
| Distillation#Params=480M, #Size=dim=2048 12 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 9.01 | |
| XPERT-DeepSeek#Params=391M, #Size=dim=2048 8 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 8.72 | |
| Scratch#Params=391M, #Size=dim=2048 8 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 8.5 | |
| XPERT-OLMoE#Params=270M, #Size=dim=1024 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 8.44 | |
| Distillation#Params=391M, #Size=dim=2048 8 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 8.34 | |
| Scratch#Params=570M, #Size=dim=2048 16 Layers, Pre-training Tokens=5B, Fine-tuning Dataset=Dolly2026.05 | 8.31 |