Agentic Reasoning in Quantum Chemistry on GRÁFICO 6 exercises (2 difficulty levels)
98.88Numerical Accuracygpt-5
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| gpt-5LLM model=gpt-52026.02 | 98.88 | 98.5 | 83,613 | 3.32 | 0.17 | 228 | 9.78 | 9.59 | 53.21 | |
| gpt-5.2LLM model=gpt-5.22026.02 | 98.69 | 96.19 | 95,153 | 4.4 | 0.22 | 180 | 8.42 | 8.27 | 64.59 | |
| gpt-5.1LLM model=gpt-5.12026.02 | 98.37 | 96.61 | 99,775 | 3.65 | 0.17 | 211 | 10.43 | 8.69 | 58.19 | |
| sonnet-4.5LLM model=sonnet-4.52026.02 | 96.07 | 95.67 | 320,397 | 6.58 | 1.09 | 273 | 26.79 | 9.02 | 83.28 | |
| gpt-4.1LLM model=gpt-4.12026.02 | 93.71 | 96.52 | 113,175 | 5.11 | 0.25 | 208 | 3.59 | 8.17 | 66.79 | |
| sonnet-3.7LLM model=sonnet-3.72026.02 | 93.69 | 90.94 | 284,036 | 9.14 | 0.92 | 404 | 19.46 | 5.07 | 86.3 | |
| qwen3-maxLLM model=qwen3-max2026.02 | 93.54 | 90.33 | 178,671 | 3.84 | 0.24 | 296 | 26.27 | 11.82 | 61.45 | |
| minimax-m2LLM model=minimax-m22026.02 | 89.66 | 87.61 | 210,018 | 6.4 | 0.05 | 315 | 21.93 | 16.38 | 78.6 | |
| El Agente QLLM model=El Agente Q2026.02 | 88.25 | — | 1,649,616 | 168.43 | 4.67 | 1,827 | — | — | — |