Instruction Following on IFBench-I
73.96AccuracyNanoV3 Elastic-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| NanoV3 Elastic-30BModel Scale=30B, Active Parameters=3.6A, Teacher Model Status=False2026.05 | 73.96 | |
| NanoV3-30B*Model Scale=30B, Active Parameters=3.6A, Teacher Model Status=True2026.05 | 73.19 | |
| NanoV3 Elastic-23BModel Scale=23B, Active Parameters=2.8A, Teacher Model Status=False2026.05 | 70.75 | |
| NanoV3 Elastic-12BModel Scale=12B, Active Parameters=2.0A, Teacher Model Status=False2026.05 | 67.39 | |
| Qwen3-30B-A3BModel Scale=30B, Active Parameters=3.3A, Teacher Model Status=False2026.05 | 46.57 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 19.8 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 19.7 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 18.9 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 18.9 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 18.7 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 16 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 15.7 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 14.8 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 14.5 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 14.1 |