Multi-agent policy synthesis on Gathering
4.59Metric UGemini 3.1 Pro
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemini 3.1 ProFeedback=reward+social2026.03 | 4.59 | 97 | 502.7 | |
| Gemini 3.1 ProFeedback=reward-only2026.03 | 4.58 | 97 | 502.5 | |
| Gemini 3.1 ProFeedback=zero-shot2026.03 | 3.71 | 79 | 443.2 | |
| Claude Sonnet 4.6Feedback=reward+social2026.03 | 3.53 | 84 | 452.7 | |
| Claude Sonnet 4.6Feedback=reward-only2026.03 | 3.47 | 72 | 402.9 | |
| GEPA (Gemini 3.1 Pro)2026.03 | 3.45 | 91 | 496.2 | |
| Claude Sonnet 4.6Feedback=zero-shot2026.03 | 1.85 | 52 | 298.6 | |
| BFS Collector2026.03 | 1.29 | 54 | 489.5 | |
| Q-learner2026.03 | 0.77 | 83 | 508.2 |