Instruction Following on IFEval v1 (test)
79.85AccuracyEntropy
Evaluation Results
| Method | Links | |
|---|---|---|
| EntropySetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 79.85 | |
| Pure OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 79.11 | |
| TA-OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.93 | |
| TA-OPD+Ent.Setting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 77.54 | |
| TIPSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 76.71 | |
| TIPSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 76.62 | |
| TA-OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 75.13 | |
| EntropySetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 73.94 | |
| BaseSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 73.57 | |
| BaseSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 73.57 | |
| TA-OPD+Ent.Setting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 73.38 | |
| Llama-3-8BInstruction-tuned=true, evaluation_protocol=strict-prompt2024.07 | 72.1 | |
| Pure OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 70.33 | |
| GLM-4-9BInstruction-tuned=true, evaluation_protocol=strict-prompt2024.07 | 69 | |
| TA-OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 64.05 | |
| Pure OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 62.85 | |
| TA-OPD+Ent.Setting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 61.73 | |
| TIPSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 60.91 | |
| EntropySetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 60.63 | |
| BaseSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 59.52 | |
| Qwen2-7BInstruction-tuned=true, evaluation_protocol=strict-prompt2024.07 | 54.7 | |
| Qwen1.5-7BInstruction-tuned=true, evaluation_protocol=strict-prompt2024.07 | 38.3 | |
| BaseSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 26.16 | |
| TIPSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 26.16 | |
| TA-OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 25.42 | |
| EntropySetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 24.68 | |
| Pure OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 23.48 | |
| TA-OPD+Ent.Setting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 23.39 |