Multi-agent system task solving on finance
76.7AccuracyTacoMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| TacoMASEvolution Time Scale=Topology-capability co-evolution, Base LLM=Gemini-2.5-flash-lite, Meta-LLM=Gemini-2.5-pro, Rubric Judge=GPT-4o-mini2026.05 | 76.7 | |
| SASEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 53.9 | |
| MAS-HybridEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 53.7 | |
| MAS-IndependentEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 52.9 | |
| MAS-CentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 50 | |
| MAS-DecentralizedEvolution Time Scale=Fixed-topology, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 44.5 | |
| MetaGenEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 41.9 | |
| CORALEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 40.9 | |
| SelfOrgEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 37.7 | |
| MetaAgentEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 34.9 | |
| MetaGPTEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 34.8 | |
| AFlowEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 34.3 | |
| ChatDev-PuppeteerEvolution Time Scale=Within-instance evolution, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 34 | |
| SwarmAgenticEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 33.8 | |
| EvolveRouterEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 33.2 | |
| EvoAgentXEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 31.3 | |
| AgentVerseEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 30.1 | |
| ARG-DesignerEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 29.5 | |
| ADASEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 29.4 | |
| AgentSquareEvolution Time Scale=Offline-evolved, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 28.6 | |
| MaASEvolution Time Scale=Per-instance graph design, Base LLM=Gemini-2.5-flash-lite, Rubric Judge=GPT-4o-mini2026.05 | 28.4 |