Multi-task Reasoning on Average Out-of-domain
49.57Accuracy (OOD)DFT
Evaluation Results
| Method | Links | |
|---|---|---|
| DFTModel=Qwen3 32B2025.10 | 49.57 | |
| VCOREModel=Qwen3 32B2025.10 | 45.93 | |
| RandomModel=Qwen3 32B2025.10 | 44.83 | |
| SFTModel=Qwen3 32B2025.10 | 43.78 | |
| iw-SFTModel=Qwen3 32B2025.10 | 42.64 | |
| OriginalModel=Qwen3 32B2025.10 | 42.52 | |
| DFTModel=Qwen3 8B2025.10 | 37.29 | |
| iw-SFTModel=Qwen3 8B2025.10 | 35.34 | |
| RandomModel=Qwen3 8B2025.10 | 35.26 | |
| VCOREModel=Qwen3 8B2025.10 | 35.26 | |
| SFTModel=Qwen3 8B2025.10 | 35.07 | |
| VCOREModel=Qwen3 4B2025.10 | 32.87 | |
| DFTModel=Qwen3 4B2025.10 | 32.49 | |
| RandomModel=Qwen3 4B2025.10 | 30.62 | |
| iw-SFTModel=Qwen3 4B2025.10 | 30.43 | |
| SFTModel=Qwen3 4B2025.10 | 30.34 | |
| OriginalModel=Qwen3 8B2025.10 | 29.58 | |
| OriginalModel=Qwen3 4B2025.10 | 26.12 | |
| OriginalModel=LLaMA3.1 8B Instruct2025.10 | 20.18 | |
| VCOREModel=LLaMA3.1 8B Instruct2025.10 | 9.59 | |
| RandomModel=LLaMA3.1 8B Instruct2025.10 | 9.07 | |
| SFTModel=LLaMA3.1 8B Instruct2025.10 | 7.71 | |
| DFTModel=LLaMA3.1 8B Instruct2025.10 | 7.17 | |
| iw-SFTModel=LLaMA3.1 8B Instruct2025.10 | 6.1 |