General AI Assistant Reasoning on GAIA Full
60.12AccuracyClaude-3.7
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=42026.01 | 60.12 | 6.71 | 7.9 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=62026.01 | 58.93 | 6.71 | 7.9 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=102026.01 | 58.93 | 6.71 | 7.9 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=82026.01 | 58.32 | 6.71 | 7.9 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=22026.01 | 56.49 | 6.71 | 7.9 | |
| Claude-3.7Backbone=Claude-3.7-Sonnet, Feedback Rounds=02026.01 | 52.22 | 6.71 | 7.9 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=22026.01 | 32.53 | 2.41 | 3.01 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=62026.01 | 32.53 | 2.41 | 3.01 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=82026.01 | 32.21 | 5.48 | 5.48 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=102026.01 | 32.21 | 5.48 | 5.48 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=42026.01 | 31.92 | 2.41 | 3.01 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=82026.01 | 31.92 | 2.41 | 3.01 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=102026.01 | 31.92 | 2.41 | 3.01 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=62026.01 | 31.6 | 5.48 | 5.48 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=22026.01 | 30.99 | 5.48 | 5.48 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=42026.01 | 30.99 | 5.48 | 5.48 | |
| GPT-4.1Backbone=GPT-4.1, Feedback Rounds=02026.01 | 29.51 | 2.41 | 3.01 | |
| DeepVerifier-8BBackbone=Llama-3-8B-Base, Feedback Rounds=02026.01 | 26.73 | 5.48 | 5.48 |