General AI Assistant Task on GAIA-127 (Accuracy)
23.6AccuracyOpenThinkerAgent-32B
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenThinkerAgent-32BTrain Size=100K, Method=SFT, Backbone=Qwen3-32B2026.06 | 23.6 | |
| Nemotron-Terminal-32BTrain Size=264K, Method=SFT, Backbone=Qwen3-32B2026.06 | 22.3 | |
| DeepSWE-PreviewTrain Size=4.5K, Method=RL, Backbone=Qwen3-32B2026.06 | 16.5 | |
| Nemotron-Terminal-8BTrain Size=264K, Training Method=SFT2026.06 | 14.4 | |
| SWE-Lego-Qwen3-32BTrain Size=18K, Method=SFT, Backbone=Qwen3-32B2026.06 | 12.9 | |
| SA-SWE-32BTrain Size=4.5K, Method=RL, Backbone=Qwen3-32B2026.06 | 11.5 | |
| Qwen3-32BTrain Size=N/A, Method=N/A, Backbone=Qwen3-32B2026.06 | 9.7 | |
| SERA-32BTrain Size=25K, Method=SFT, Backbone=Qwen3-32B2026.06 | 8.7 | |
| OT-Agent-ColdSFT+RL-8BBase Model=OpenThinker-Agent-v1-SFT, Train Size=10K+5K, Training Method=SFT+RL2026.06 | 6.8 | |
| OT-Agent-SFT-8B (100K)Base Model=OpenThinker-Agent-v1-SFT, Train Size=100K, Training Method=SFT2026.06 | 6.6 | |
| SWE-Lego-Qwen3-8BBase Model=Qwen3-8B, Train Size=18K, Training Method=SFT2026.06 | 6 | |
| OT-Agent-SFT-8B (10K)Base Model=OpenThinker-Agent-v1-SFT, Train Size=10K, Training Method=SFT2026.06 | 5.5 | |
| Endless TerminalsBase Model=Qwen3-8B, Train Size=15K+3K, Training Method=SFT+RL2026.06 | 5.2 | |
| Qwen3-8BBase Model=N/A, Train Size=N/A, Training Method=N/A2026.06 | 5 |