STEM Reasoning on Super GPQA
2.096Speedup RatioMTP-D
Evaluation Results
| Method | Links | |
|---|---|---|
| MTP-DLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=350B tokens2026.03 | 2.096 | |
| MTP-D ensembleLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 2.026 | |
| MTP-DLoop strategy=4, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.994 | |
| MTP-DLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.98 | |
| MTPLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.951 | |
| MTP-DLoop strategy=4 to 8, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.884 | |
| MTP-DLoop strategy=1 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.865 | |
| MTPLoop strategy=1 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.733 | |
| MTP-DLoop strategy=4 to 8 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.676 | |
| MTP-DLoop strategy=4 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.648 | |
| MTP-DLoop strategy=1 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.571 | |
| MTP-DLoop strategy=4 to 16, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.496 | |
| MTP-DLoop strategy=1 to 8, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.28 | |
| MTP-DLoop strategy=1 to 16, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.05 | |
| MTP-DLoop strategy=1, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.016 |