ResearchBenchmarksMulti-task Language Evaluation on Aggregate (All)Follow41.2AccuracyNexus21.02426.26231.536.738Apr 10, 2026Evaluation ResultsMethodMethodLinksAccuracyLossNexusModel scale=3BModel scale=3B2026.0441.21.786AdamModel scale=3BModel scale=3B2026.04391.812NexusModel scale=1BModel scale=1B2026.0423.51.984AdamModel scale=1BModel scale=1B2026.0421.82.011