Domain-specific language task evaluation on CyberMetric
86.8AccuracyHyTuning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HyTuningBackbone=Qwen2.5-14B, Post-training Strategy=HyTuning2026.04 | 86.8 | 0.8 | |
| Qwen2.5-14BBackbone=Qwen2.5-14B, Post-training Strategy=Base2026.04 | 81.8 | 4.4 | |
| HyTuningBackbone=Qwen2.5-7B, Post-training Strategy=HyTuning2026.04 | 78.8 | 3.8 | |
| HyTuningBackbone=Qwen2.5-3B, Post-training Strategy=HyTuning2026.04 | 73.2 | 6.8 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, Post-training Strategy=Base2026.04 | 70.8 | 16.4 | |
| INTUITORBackbone=Qwen2.5-3B, Post-training Strategy=INTUITOR2026.04 | 70 | 9.2 | |
| RLVRBackbone=Qwen2.5-3B, Post-training Strategy=RLVR2026.04 | 56 | 29.8 | |
| RLPRBackbone=Qwen2.5-3B, Post-training Strategy=RLPR2026.04 | 55.8 | 30.4 | |
| HPTBackbone=Qwen2.5-3B, Post-training Strategy=HPT2026.04 | 55.8 | 30.4 | |
| Qwen2.5-3BBackbone=Qwen2.5-3B, Post-training Strategy=Base2026.04 | 55.6 | 30.8 | |
| SFTBackbone=Qwen2.5-3B, Post-training Strategy=SFT2026.04 | 55.2 | 29.6 | |
| RDBackbone=Qwen2.5-3B, Post-training Strategy=RD2026.04 | 53.2 | 32.4 |