Domain-specific language task evaluation on CSEBenchmark
60.2AccuracyHyTuning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HyTuningBackbone=Qwen2.5-14B, Post-training Strategy=HyTuning2026.04 | 60.2 | 2 | |
| Qwen2.5-14BBackbone=Qwen2.5-14B, Post-training Strategy=Base2026.04 | 55.1 | 3.1 | |
| HyTuningBackbone=Qwen2.5-7B, Post-training Strategy=HyTuning2026.04 | 48 | 5.7 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, Post-training Strategy=Base2026.04 | 46 | 9.8 | |
| HyTuningBackbone=Qwen2.5-3B, Post-training Strategy=HyTuning2026.04 | 39.1 | 7 | |
| INTUITORBackbone=Qwen2.5-3B, Post-training Strategy=INTUITOR2026.04 | 32.1 | 14.7 | |
| RLPRBackbone=Qwen2.5-3B, Post-training Strategy=RLPR2026.04 | 31.9 | 17.5 | |
| Qwen2.5-3BBackbone=Qwen2.5-3B, Post-training Strategy=Base2026.04 | 31.8 | 17.6 | |
| HPTBackbone=Qwen2.5-3B, Post-training Strategy=HPT2026.04 | 31.8 | 17.6 | |
| SFTBackbone=Qwen2.5-3B, Post-training Strategy=SFT2026.04 | 31.7 | 16.9 | |
| RLVRBackbone=Qwen2.5-3B, Post-training Strategy=RLVR2026.04 | 31.7 | 16.8 | |
| RDBackbone=Qwen2.5-3B, Post-training Strategy=RD2026.04 | 31.3 | 17.5 |