ResearchBenchmarksMultitask Language Understanding on MMLUFollow4.46Average Relative ImprovementTBDF-0.81280.55611.9253.2939Jan 29, 2026Evaluation ResultsMethodMethodLinksAverage Relative ImprovementSuperior/Inferior RatioTBDFFiltering Mode=FW-EDU,...Filtering Mode=FW-EDU, Models=Gemma 3 (270M, 1B, 4B)2026.014.46—TBDFFiltering Mode=General...Filtering Mode=General, Models=Gemma 3 (270M, 1B, 4B)2026.011.52—CBFiltering Mode=FW-EDU,...Filtering Mode=FW-EDU, Models=Gemma 3 (270M, 1B, 4B)2026.01-0.61—