Question Answering on DocBench
85.1AccuracyEvolved Agent
Evaluation Results
| Method | Links | |
|---|---|---|
| Evolved AgentModel=Gemini-3.1-Flash, Evolved=true2026.06 | 85.1 | |
| Evolved Agent, No Ground TruthModel=Gemini-3.1-Flash, Evolved=true2026.06 | 84 | |
| SimpleDocModel=Gemini-3.1-Flash, Evolved=false2026.06 | 82.2 | |
| Evolved Agent, GPT-5-minimal Meta AgentModel=Gemini-3.1-Flash, Evolved=true2026.06 | 79.8 | |
| MACTModel=Gemini-3.1-Flash, Evolved=false2026.06 | 79.7 | |
| Evolved AgentModel=GPT-5-mini, Evolved=true2026.06 | 79.3 | |
| MDocAgentModel=Gemini-3.1-Flash, Evolved=false2026.06 | 78.6 | |
| Evolved Agent, No ExplorationModel=Gemini-3.1-Flash, Evolved=true2026.06 | 77.3 | |
| Evolved Agent, No Ground TruthModel=GPT-5-mini, Evolved=true2026.06 | 75.6 | |
| Evolved Agent, GPT-5-minimal Meta AgentModel=GPT-5-mini, Evolved=true2026.06 | 75.6 | |
| SimpleDocModel=GPT-5-mini, Evolved=false2026.06 | 74.8 | |
| Evolved Agent, No ExplorationModel=GPT-5-mini, Evolved=true2026.06 | 74.8 | |
| Baseline AgentModel=Gemini-3.1-Flash, Evolved=false2026.06 | 73.4 | |
| MACTModel=GPT-5-mini, Evolved=false2026.06 | 73.3 | |
| File APIModel=GPT-5-mini, Evolved=false2026.06 | 72.1 | |
| File APIModel=Gemini-3.1-Flash, Evolved=false2026.06 | 71.7 | |
| MDocAgentModel=GPT-5-mini, Evolved=false2026.06 | 70.1 | |
| Baseline AgentModel=GPT-5-mini, Evolved=false2026.06 | 68.6 | |
| CoTModel=Gemini-3.1-Flash, Evolved=false2026.06 | 66.1 | |
| CoTModel=GPT-5-mini, Evolved=false2026.06 | 57.4 |