Multi-agent system task solving on plancraft
88.7AccuracyTacoMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| TacoMASEvolution Time Scale=Topology-capability co-evolution, Base LLM=Gemini-2.5-flash-lite, Meta-LLM=Gemini-2.5-pro, Rubric Judge=GPT-4o-mini2026.05 | 88.7 | |
| SwarmAgenticEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 81.2 | |
| EvoAgentXEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 76.3 | |
| AFlowEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 71.7 | |
| SelfOrgEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 71.2 | |
| MAS-IndependentEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 71 | |
| MetaGPTEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 66.8 | |
| AgentVerseEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 65.3 | |
| ARG-DesignerEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 61.9 | |
| MAS-DecentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 60 | |
| AgentSquareEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 57.4 | |
| MetaAgentEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 56 | |
| MAS-CentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 56 | |
| ChatDev-PuppeteerEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 55.3 | |
| MAS-HybridEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 54 | |
| SASEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 53 | |
| ADASEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 49.7 | |
| MaASEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 49.2 | |
| MetaGenEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 47.9 | |
| CORALEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 45.8 | |
| EvolveRouterEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 32 |