Multi-agent system task solving on workbench
82.4AccuracyTacoMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| TacoMASEvolution Time Scale=Topology-capability co-evolution, Base LLM=Gemini-2.5-flash-lite, Meta-LLM=Gemini-2.5-pro, Rubric Judge=GPT-4o-mini2026.05 | 82.4 | |
| SwarmAgenticEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 65.1 | |
| ADASEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 64.5 | |
| ARG-DesignerEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 59.5 | |
| MaASEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 53.8 | |
| AgentVerseEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 52.3 | |
| CORALEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 51.1 | |
| MetaGenEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 49.2 | |
| AFlowEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 47.8 | |
| MetaGPTEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 47.3 | |
| MetaAgentEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 46.9 | |
| MAS-DecentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 44.6 | |
| ChatDev-PuppeteerEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 44.1 | |
| SelfOrgEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 44.1 | |
| AgentSquareEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 44 | |
| EvoAgentXEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 41.9 | |
| MAS-IndependentEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 41.6 | |
| MAS-CentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 38.6 | |
| MAS-HybridEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 38.6 | |
| SASEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 34.7 | |
| EvolveRouterEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 29 |