Theorem Proving on Small-scale benchmark Overall
33VRGemini-3-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-ProThinking level=low, Expert Calls=1608, Tokens (M)=7.9, Cost (USD)=65.212026.01 | 33 | |
| Claude-Sonnet-4.5 (Agentic)Expert Calls=2072, Tokens (M)=5.12, Cost (USD)=32.832026.01 | 29 | |
| Gemini-3-FlashThinking level=low, Expert Calls=1616, Tokens (M)=4.7, Cost (USD)=6.942026.01 | 23 | |
| DeepSeek-V3.2 (Agentic)Expert Calls=1100, Tokens (M)=3.14, Cost (USD)=2.782026.01 | 18 | |
| Qwen-Max (Agentic)Expert Calls=796, Tokens (M)=2.94, Cost (USD)=2.452026.01 | 16 | |
| BaselineExpert Calls=7362026.01 | 15 | |
| GPT-5.2 (Agentic)Expert Calls=1372, Tokens (M)=3.41, Cost (USD)=17.272026.01 | 14 | |
| DeepSeek-V3.2-Thinking (Agentic)Expert Calls=900, Tokens (M)=3.09, Cost (USD)=2.722026.01 | 13 |