ResearchBenchmarksMulti-task Language Understanding on MMLU (Accuracy and Standard Deviation)Follow71.82AccuracyFew-shot34.036843.845953.65563.4641Feb 15, 2026Evaluation ResultsMethodMethodLinksAccuracyStandard DeviationFew-shotModel=Qwen3-8B, Traini...Model=Qwen3-8B, Training Size=1002026.0271.820.03ROASTModel=Qwen3-0.6B, Trai...Model=Qwen3-0.6B, Training Size=100, Aggregation=group2026.0240.730.02SADIModel=Gemma3-1B, Train...Model=Gemma3-1B, Training Size=1002026.0240.380.41BaselineModel=Qwen3-0.6BModel=Qwen3-0.6B2026.0235.490.01