Agentic Question Answering on AirQA
51.85SGL ScoreGemini-2.5-Pro
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.09 | 51.85 | 18.58 | 67.01 | 40.49 | 51.53 | 29.58 | 29.95 | 33.86 | 53.28 | 46.55 | 38.23 | 44.14 | |
| GPT-4oModel=GPT-4o2025.09 | 45.58 | 10.53 | 52.13 | 35.56 | 39.61 | 23 | 25.6 | 33.86 | 47.54 | 38.76 | 29.09 | 35.96 | |
| Claude-3.7-SonnetModel=Claude-3.7-Sonnet2025.09 | 45.3 | 15.17 | 58.68 | 27.46 | 43.96 | 22.07 | 24.64 | 27.56 | 44.26 | 39.32 | 29.64 | 36.52 | |
| DeepSeek-R1Model=DeepSeek-R12025.09 | 41.03 | 11.46 | 41.67 | 22.54 | 35.1 | 15.96 | 20.77 | 20.47 | 39.34 | 30.4 | 26.59 | 29.29 | |
| Qwen2.5-72B-InstructModel=Qwen2.5-72B-Instruct2025.09 | 39.03 | 10.84 | 55.21 | 37.32 | 41.71 | 13.15 | 28.02 | 30.71 | 45.9 | 37.74 | 28.53 | 35.07 | |
| o1-miniModel=o1-mini2025.09 | 37.04 | 12.07 | 45.14 | 24.65 | 35.43 | 14.55 | 22.22 | 22.83 | 36.07 | 31.07 | 26.04 | 29.61 | |
| Llama-3.3-70B-InstructModel=Llama-3.3-70B-Instruct2025.09 | 29.06 | 9.29 | 42.71 | 24.3 | 32.37 | 8.92 | 21.74 | 19.69 | 30.33 | 28.47 | 19.94 | 26 |