Multiple-choice Reasoning on Hellaswag (bo)
39.16AccuracyOurs-MoE-SFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ours-MoE-SFTModel=Ours-MoE-SFT2025.07 | 39.16 | 45.71 | |
| Ours-SFTalignment=SFT2025.07 | 30.64 | 36.71 | |
| Ours-SFTModel=Ours-SFT2025.07 | 30.64 | 36.71 | |
| Ours-Basemode=base2025.07 | 30.3 | 36.2 | |
| Ours-BaseModel=Ours-Base2025.07 | 30.3 | 36.2 | |
| Ours-Base-32kcontext-length=32k2025.07 | 30.09 | 36.58 | |
| Ours-Base-32kModel=Ours-Base-32k2025.07 | 30.09 | 36.58 | |
| Ours-MoE-Base-8kModel=Ours-MoE-Base-8k2025.07 | 29.68 | 36.29 | |
| Ours-MoE-BaseModel=Ours-MoE-Base2025.07 | 29.54 | 36.16 | |
| LLaMA3.1-8B-InstructModel=LLaMA3.1-8B-Instruct2025.07 | 27.28 | 32 | |
| Qwen3-8BModel=Qwen3-8B2025.07 | 27.07 | 30.56 | |
| Qwen2.5-7B-baseModel=Qwen2.5-7B-base2025.07 | 26.69 | 31.57 | |
| Qwen2.5-7B-InstructModel=Qwen2.5-7B-Instruct2025.07 | 26.46 | 31.03 | |
| Tibetan-Llama2-7Bbackbone=Llama2-7B2025.07 | 26.09 | 27.58 | |
| DeepSeek-R1-Distill-Llama-8BModel=DeepSeek-R1-Distill-Llama-8B2025.07 | 25.96 | 30.67 | |
| Tibetan-Alpaca-7Bbackbone=Alpaca-7B2025.07 | 25.95 | 28.23 | |
| Yak-Llama2-7Bbackbone=Llama2-7B2025.07 | 24.67 | 26.4 |