General AI Assistant Reasoning on GAIA (File/Reasoning/Others)
56.21AccuracyClaude-3.7
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=42026.01 | 56.21 | 1.35 | 2.64 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=62026.01 | 54.92 | 1.35 | 2.64 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=82026.01 | 54.92 | 1.35 | 2.64 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=102026.01 | 54.92 | 1.35 | 2.64 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=02026.01 | 53.57 | 1.35 | 2.64 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=22026.01 | 53.57 | 1.35 | 2.64 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=22026.01 | 33.33 | 2.67 | 2.67 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=42026.01 | 33.33 | 2.67 | 2.67 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=62026.01 | 33.33 | 2.67 | 2.67 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=82026.01 | 33.33 | 2.67 | 2.67 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=102026.01 | 33.33 | 2.67 | 2.67 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=22026.01 | 30.85 | 4.04 | 4.04 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=42026.01 | 30.85 | 4.04 | 4.04 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=62026.01 | 30.85 | 4.04 | 4.04 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=82026.01 | 30.85 | 4.04 | 4.04 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=102026.01 | 30.85 | 4.04 | 4.04 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=02026.01 | 30.67 | 2.67 | 2.67 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=02026.01 | 26.81 | 4.04 | 4.04 |