Common-sense Reasoning on BBH
58.27AccuracyReMiT
Evaluation Results
| Method | Links | |
|---|---|---|
| ReMiTModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 58.27 | |
| MiniPLMModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 57.1 | |
| Vanilla NTPModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 56.5 | |
| RHO-1Model Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 55.32 | |
| ReMiTModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 47.21 | |
| SFTMethod=Supervised Fine-Tuning2026.01 | 45.56 | |
| T-SPINIteration=Iter22026.01 | 45.05 | |
| T-SPINIteration=Iter32026.01 | 44.97 | |
| T-SPINIteration=Iter12026.01 | 44.91 | |
| T-SPINIteration=Iter42026.01 | 44.9 | |
| SPINIteration=Iter02026.01 | 44.56 | |
| Vanilla NTPModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 44.37 | |
| Mistral-7BConfiguration=Base2026.01 | 44.26 | |
| MiniPLMModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 44.2 | |
| T-SPINIteration=Iter02026.01 | 44.06 | |
| Pre-TrainedModel Family=Youtu-LLM-2B, Mid-Training=Standard Checkpoint, Few-shot=True2026.02 | 43.39 | |
| Pre-TrainedModel Family=SmolLM3-3B, Mid-Training=Standard Checkpoint, Few-shot=True2026.02 | 43.13 | |
| SPINIteration=Iter42026.01 | 42.88 | |
| SPINIteration=Iter12026.01 | 42.5 | |
| SPINIteration=Iter22026.01 | 41.97 | |
| SPINIteration=Iter32026.01 | 41.4 | |
| RHO-1Model Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 40.45 | |
| ReMiTModel Family=OLMo-1B, Mid-Training=True, Few-shot=True2026.02 | 32.07 | |
| Vanilla NTPModel Family=OLMo-1B, Mid-Training=True, Few-shot=True2026.02 | 30.87 | |
| MiniPLMModel Family=OLMo-1B, Mid-Training=True, Few-shot=True2026.02 | 30.38 | |
| RHO-1Model Family=OLMo-1B, Mid-Training=True, Few-shot=True2026.02 | 29.33 | |
| Pre-TrainedModel Family=OLMo-1B, Mid-Training=Standard Checkpoint, Few-shot=True2026.02 | 28.43 |