Zero-shot Downstream Evaluation on LM Evaluation Harness v1.0.0
50.1HellaSwag AccuracyBaseline FT
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Baseline FTBackbone=Qwen3-0.6B, Evaluation Protocol=0-shot, Training Task=Fine-tuning on FineWeb-Edu, Training Steps=20K, Mode=Standard fine-tuning2026.05 | 50.1 | 61.5 | 36.7 | 69.2 | 57 | 70.3 | 45.2 | 50 | 55 | |
| Delta BlockBackbone=Qwen3-0.6B, Evaluation Protocol=0-shot, Training Task=Fine-tuning on FineWeb-Edu, Training Steps=20K, Configuration=Delta Block + Null Source2026.05 | 50 | 66.5 | 37.3 | 69.4 | 56.7 | 70.3 | 44.8 | 49.8 | 55.6 | |
| AttnResBackbone=Qwen3-0.6B, Evaluation Protocol=0-shot, Training Task=Fine-tuning on FineWeb-Edu, Training Steps=20K2026.05 | 49.4 | 60.2 | 35.3 | 68.8 | 57.9 | 70.3 | 42.5 | 48.4 | 54.1 | |
| PretrainedBackbone=Qwen3-0.6B, Evaluation Protocol=0-shot, Status=Pretrained2026.05 | 47.3 | 56.2 | 33.9 | 67.4 | 55.9 | 63.8 | 40.3 | 40 | 50.6 |