Uncertainty Attribution on UA-Bench Reasoning-intensive Tasks
89.8AccuracyGemini 3 Flash
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Gemini 3 FlashMode=Non-Thinking2026.04 | 89.8 | 57.6 | 70.7 | 64.1 | |
| GPT-OSS 120BMode=Thinking2026.04 | 81.3 | 54.7 | 62.4 | 58.6 | |
| Qwen3-32BMode=Thinking2026.04 | 80.4 | 62.8 | 35 | 48.9 | |
| Qwen3-235B-A22B-Thinking-2507Mode=Thinking2026.04 | 80 | 68.1 | 0 | 34.1 | |
| Qwen3-235B-A22B-Instruct-2507Mode=Non-Thinking2026.04 | 78.9 | 70.4 | 84.8 | 77.6 | |
| GPT-OSS 20BMode=Thinking2026.04 | 78.9 | 56.2 | 47.4 | 51.8 | |
| Qwen3-8BMode=Thinking2026.04 | 77.7 | 47.4 | 18.7 | 33 | |
| GPT-5 miniMode=Thinking2026.04 | 76.6 | 60.2 | 89.5 | 74.9 | |
| Qwen3-4B-Instruct-2507Mode=Non-Thinking2026.04 | 72.3 | 68.6 | 23.3 | 45.9 | |
| Claude Sonnet 4Mode=Non-Thinking2026.04 | 62.5 | 82.5 | 86.6 | 84.4 | |
| LLaMA-4-MaverickMode=Non-Thinking2026.04 | 59.5 | 72.1 | 46.3 | 59.2 | |
| Qwen3-8BMode=Non-Thinking2026.04 | 53.9 | 73.1 | 24.5 | 48.8 | |
| Qwen3-32BMode=Non-Thinking2026.04 | 52.4 | 76.8 | 52.2 | 64.5 | |
| GPT-4oMode=Non-Thinking2026.04 | 38.1 | 82.3 | 80.6 | 81.4 | |
| GPT-4o miniMode=Non-Thinking2026.04 | 37.2 | 74.9 | 8 | 41.5 | |
| Qwen3-1.7BMode=Thinking2026.04 | 35.6 | 38.5 | 12.7 | 25.6 | |
| Qwen3-4B-Thinking-2507Mode=Thinking2026.04 | 35.5 | 60.7 | 10.9 | 35.8 | |
| Qwen3-1.7BMode=Non-Thinking2026.04 | 16 | 36.1 | 36.6 | 36.4 |