ResearchBenchmarksCode Generation on HumanEval (Acc, F1, Avg. Tokens (K))Follow92.68AccuracySUPERVISORAGENT73.33678.35883.3888.402Oct 30, 2025Evaluation ResultsMethodMethodLinksAccuracyF1 ScoreAverage Tokens (K)SUPERVISORAGENTmodule=SMAS, base_agen...module=SMAS, base_agent=Smolagent2025.1092.6892.6831.19Smolagent2025.1092.0792.0740.91OWL2025.1090.7490.7431.87CoT SCshots=3-shotshots=3-shot2025.1077.7877.781.42Vanilla2025.1076.8276.820.28MetaAgent2025.1074.0874.082.59