Domain-specific language task evaluation on ASBench
55.5AccuracyHyTuning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HyTuningBackbone=Qwen2.5-14B, Post-training Strategy=HyTuning2026.04 | 55.5 | 1.3 | |
| Qwen2.5-14BBackbone=Qwen2.5-14B, Post-training Strategy=Base2026.04 | 54.1 | 4.5 | |
| HyTuningBackbone=Qwen2.5-7B, Post-training Strategy=HyTuning2026.04 | 51.4 | 1.4 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, Post-training Strategy=Base2026.04 | 49.5 | 7.1 | |
| HyTuningBackbone=Qwen2.5-3B, Post-training Strategy=HyTuning2026.04 | 48.9 | 4.2 | |
| INTUITORBackbone=Qwen2.5-3B, Post-training Strategy=INTUITOR2026.04 | 47.6 | 8 | |
| SFTBackbone=Qwen2.5-3B, Post-training Strategy=SFT2026.04 | 27.4 | 48.6 | |
| RDBackbone=Qwen2.5-3B, Post-training Strategy=RD2026.04 | 27.1 | 49.2 | |
| RLVRBackbone=Qwen2.5-3B, Post-training Strategy=RLVR2026.04 | 27.1 | 49.2 | |
| Qwen2.5-3BBackbone=Qwen2.5-3B, Post-training Strategy=Base2026.04 | 26.9 | 50 | |
| RLPRBackbone=Qwen2.5-3B, Post-training Strategy=RLPR2026.04 | 26.9 | 50.2 | |
| HPTBackbone=Qwen2.5-3B, Post-training Strategy=HPT2026.04 | 26.9 | 49.9 |