Knowledge Retrieval on Simple QA
3.884Speedup RatioMTP-D
Evaluation Results
| Method | Links | |
|---|---|---|
| MTP-DLoop strategy=4 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.884 | |
| MTP-D ensembleLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.678 | |
| MTP-DLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=350B tokens2026.03 | 3.659 | |
| MTP-DLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.591 | |
| MTP-DLoop strategy=4 to 8 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.577 | |
| MTP-DLoop strategy=1 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.505 | |
| MTPLoop strategy=1 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.44 | |
| MTPLoop strategy=4 to 8, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 3.368 | |
| MTP-DLoop strategy=4 to 8, Training protocol=Training Free, Training data size=70B tokens2026.03 | 2.885 | |
| MTP-DLoop strategy=1 to 16, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 2.839 | |
| MTP-DLoop strategy=4 to 16, Training protocol=Training Free, Training data size=70B tokens2026.03 | 2.806 | |
| MTP-DLoop strategy=4, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 2.594 | |
| MTP-DLoop strategy=1 to 8, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.971 | |
| MTP-DLoop strategy=1 to 16, Training protocol=Training Free, Training data size=70B tokens2026.03 | 1.753 | |
| MTP-DLoop strategy=1, Training protocol=Continued pre-training, Training data size=70B tokens2026.03 | 1.196 |