Multi-agent system task solving on BrowseComp
74.5AccuracyTacoMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| TacoMASEvolution Time Scale=Topology-capability co-evolution, Base LLM=Gemini-2.5-flash-lite, Meta-LLM=Gemini-2.5-pro, Rubric Judge=GPT-4o-mini2026.05 | 74.5 | |
| SelfOrgEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 68.8 | |
| AFlowEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 63.3 | |
| AgentSquareEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 62.5 | |
| AgentVerseEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 62.5 | |
| ARG-DesignerEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 62.1 | |
| MaASEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 62 | |
| ChatDev-PuppeteerEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 60.3 | |
| MetaAgentEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 60.1 | |
| ADASEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 59.5 | |
| EvoAgentXEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 59.1 | |
| SwarmAgenticEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 57 | |
| MetaGPTEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 55 | |
| MetaGenEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 51.3 | |
| CORALEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 50.5 | |
| MAS-CentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 27 | |
| MAS-HybridEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 26 | |
| MAS-DecentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 24 | |
| SASEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 20 | |
| EvolveRouterEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 17 | |
| MAS-IndependentEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 9 |