General Reasoning on HLE
38.4AccuracyGemini-3.0
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-3.0version=Pro2026.02 | 38.4 | 13,000 | |
| Gemini 3-Pro2026.02 | 37.5 | — | |
| Kimi K2.52026.02 | 31.5 | 24,000 | |
| ERNIE 5.02026.02 | 25.81 | — | |
| DS V3.2-Thinking2026.02 | 25.1 | — | |
| DeepSeek-V3.2mode=Thinking2026.02 | 25.1 | 21,000 | |
| GPT-5 (High)2026.02 | 24.8 | — | |
| Kimi K2mode=Thinking2026.02 | 23.9 | 29,000 | |
| Gemini 2.5-Pro2026.02 | 21.6 | — | |
| gpt-oss-120BReasoning effort=High, KV cache precision=FP82026.02 | 18.86 | — | |
| gpt-oss-120BReasoning effort=High, KV cache precision=BF162026.02 | 18.16 | — | |
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=BF162026.02 | 17.52 | — | |
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=FP82026.02 | 16.4 | — | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=BF162026.02 | 10.57 | — | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=FP82026.02 | 10.47 | — | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=BF162026.02 | 10.06 | — | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=FP82026.02 | 9.68 | — | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=FP82026.02 | 5.51 | — | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=BF162026.02 | 5.33 | — | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=FP82026.02 | 4.4 | — | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=BF162026.02 | 4.17 | — |