Mathematical Reasoning on MATH 500 (Accuracy Avg@8)
89.05Accuracy (Avg@8)L1-Qwen-7B-Max
Evaluation Results
| Method | Links | |
|---|---|---|
| L1-Qwen-7B-Max# Bits=BF16, Backbone=L1-Qwen-7B-Max2026.05 | 89.05 | |
| FlexRound+LFQ# Bits=W4, Backbone=L1-Qwen-7B-Max2026.05 | 88.4 | |
| FlexRound# Bits=W4, Backbone=L1-Qwen-7B-Max2026.05 | 87.45 | |
| FlexRound+LFQ# Bits=W3g128, Backbone=L1-Qwen-7B-Max2026.05 | 86.5 | |
| FlexRound# Bits=W3g128, Backbone=L1-Qwen-7B-Max2026.05 | 85.35 | |
| TOP-DStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 77.33 | |
| DeepSeek-R1-Distill-Llama-8B# Bits=BF16, Backbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 72.53 | |
| FlexRound+LFQ# Bits=W4, Backbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 71.95 | |
| OPDStudent Model=Qwen3-1.7B-Base, Paradigm=Distillation, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 71.13 | |
| FlexRound# Bits=W4, Backbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 70.1 | |
| FlexRound+LFQ# Bits=W3g128, Backbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 69.25 | |
| FlexRound# Bits=W3g128, Backbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 67 | |
| DAPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 61.88 | |
| BaseStudent Model=Qwen3-1.7B-Base, Paradigm=Base, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 56.8 | |
| GRPOStudent Model=Qwen3-1.7B-Base, Paradigm=RLVR, Teacher Model=Qwen3-30B-A3B-Instruct-25072026.07 | 54.73 |