ResearchBenchmarksDownstream Language Understanding and Reasoning on Nine-benchmark evaluation suiteFollow32.1MMLU AccuracyFLUX29.70830.32930.9531.571Mar 14, 2026Evaluation ResultsMethodMethodLinksMMLU AccuracyARC-Easy AccuracyARC-Challenge AccuracyCSQA AccuracyHellaSwag AccuracyOpenBookQA AccuracyPIQA AccuracySocialIQA AccuracyWinoGrande AccuracyAggregate ScoreFLUXModel Scale=3B, Traini...Model Scale=3B, Training Tokens=60B2026.0332.166.637.25754.14572.248.954.251.92DCLMModel Scale=3B, Traini...Model Scale=3B, Training Tokens=60B2026.0331.967.334.354.852.445.470.346.751.350.48FineWebModel Scale=3B, Traini...Model Scale=3B, Training Tokens=60B2026.0329.860.233.754.851.54070.647.151.848.83