Reasoning on BBH (Score)
84.5BBH ScoreQwen2-57BA14B-it
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-57BA14B-it#Params=52B2026.05 | 84.5 | |
| Sequentially MTL#Params=8B2026.05 | 76.3 | |
| SkillWeave (Delta-Come replacement)#Params=10B2026.05 | 76.3 | |
| SKillWeave (Ours)#Params=10B2026.05 | 76.2 | |
| EMR-Merging#Params=16.7B2026.05 | 75.8 | |
| Twin-Merging r1024#Params=21B2026.05 | 75.3 | |
| Gemma2-27B-it#Params=27B2026.05 | 74.9 | |
| TALL-Mask#Params=16.7B2026.05 | 74.6 | |
| SkillWeave (ASVD replacement)#Params=10B2026.05 | 74.3 | |
| Qwen2.5-14B#Params=14B2026.05 | 73 | |
| SkillWeave (Self-Rewarding replacement)#Params=10B2026.05 | 72.4 | |
| Twin-Merging r512#Params=14.1B2026.05 | 71.5 | |
| PCB-Merge+DARE#Params=8B2026.05 | 71.2 | |
| Routed LoRA r1024#Params=21B2026.05 | 71.2 | |
| PCB-Merging#Params=8B2026.05 | 70.9 | |
| Ties-Merging#Params=8B2026.05 | 70.1 | |
| FuseChat3.0#Params=8B2026.05 | 69.4 | |
| Task Arithmetic#Params=8B2026.05 | 68.9 | |
| Routed LoRA r512#Params=14.1B2026.05 | 68.8 | |
| SkillWeave (PEFT replacement)#Params=10B2026.05 | 68.5 | |
| Qwen1.5-72B-Chat#Params=72B2026.05 | 68.3 | |
| SkillWeave (Self-Specialize replacement)#Params=10B2026.05 | 68.3 | |
| Self-MoE#Params=9B2026.05 | 67.8 | |
| Jointly MTL#Params=8B2026.05 | 67.3 | |
| FuseLLM#Params=8B2026.05 | 66.6 | |
| Self-Rewarding#Params=8B2026.05 | 66.4 | |
| Llama3.1-8B-Instruct#Params=8B2026.05 | 65.8 | |
| Self-Align#Params=8B2026.05 | 65.5 | |
| GateKDTeacher Scale=7B, Student Scale=1.1B2026.05 | 48.9 | |
| Mentor-KDTeacher Scale=7B, Student Scale=1.1B2026.05 | 44.3 | |
| Vanilla-KDTeacher Scale=7B, Student Scale=1.1B2026.05 | 41.7 | |
| ARPipeline=Qwen3-0.6B2026.04 | 41.5 | |
| UniTeModel Scale=0.5B, Evaluation=0-shot2026.06 | 30.9 | |
| GaCModel Scale=0.5B, Evaluation=0-shot2026.06 | 30.79 | |
| DLLGModel Scale=0.5B, Evaluation=0-shot2026.06 | 30.56 | |
| Pack of LLMsModel Scale=0.5B, Evaluation=0-shot2026.06 | 30.09 | |
| Task ArithmeticModel Scale=0.5B, Evaluation=0-shot2026.06 | 29.51 | |
| LinearModel Scale=0.5B, Evaluation=0-shot2026.06 | 29.39 | |
| Qwen2.5-0.5B-InstructModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.78 | |
| EmbedLLMModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.78 | |
| Entropy WeightingModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.66 | |
| SLERPModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.43 | |
| TIDE-CrossPipeline=Cross-Tokenizer2026.04 | 27.37 | |
| Qwen2.5-Coder-0.5B-InstructModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.2 | |
| Token Maj-VotingModel Scale=0.5B, Evaluation=0-shot2026.06 | 27.2 | |
| TIDE-SharedPipeline=Cross-Tokenizer2026.04 | 26.85 | |
| TIDE-SharedPipeline=Shared-Tokenizer2026.04 | 26.79 | |
| BD3LMPipeline=Qwen3-0.6B2026.04 | 26.32 | |
| Dolphin3.0-Qwen2.5-0.5BModel Scale=0.5B, Evaluation=0-shot2026.06 | 26.16 | |
| RouterDCModel Scale=0.5B, Evaluation=0-shot2026.06 | 26.16 | |
| TIDE-CrossPipeline=Shared-Tokenizer2026.04 | 26 | |
| KLPipeline=Shared-Tokenizer2026.04 | 25.79 | |
| CALMPipeline=Cross-Tokenizer2026.04 | 24.21 |