Uncertainty Attribution on UA-Bench Knowledge-intensive Tasks
32.3AccuracyGemini 3 Flash
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Gemini 3 FlashMode=Non-Thinking2026.04 | 32.3 | 72 | 29 | 50.5 | |
| LLaMA-4-MaverickMode=Non-Thinking2026.04 | 20.3 | 71 | 38.6 | 54.8 | |
| Qwen3-235B-A22B-Instruct-2507Mode=Non-Thinking2026.04 | 18 | 73.2 | 53.2 | 63.2 | |
| GPT-OSS 120BMode=Thinking2026.04 | 17.3 | 72 | 48.5 | 60.2 | |
| GPT-4o miniMode=Non-Thinking2026.04 | 15.6 | 66.9 | 30.2 | 48.6 | |
| Qwen3-235B-A22B-Thinking-2507Mode=Thinking2026.04 | 14.4 | 67.9 | 40.5 | 54.2 | |
| GPT-4oMode=Non-Thinking2026.04 | 10.4 | 78.2 | 66.6 | 72.4 | |
| GPT-OSS 20BMode=Thinking2026.04 | 9.8 | 67.7 | 24.6 | 46.1 | |
| Qwen3-32BMode=Thinking2026.04 | 8.8 | 73.1 | 65 | 69 | |
| Claude Sonnet 4Mode=Non-Thinking2026.04 | 8.3 | 74.2 | 67.4 | 70.8 | |
| Qwen3-32BMode=Non-Thinking2026.04 | 8 | 74 | 55.2 | 64.6 | |
| Qwen3-4B-Instruct-2507Mode=Non-Thinking2026.04 | 6.1 | 67.6 | 7.6 | 37.6 | |
| Qwen3-8BMode=Non-Thinking2026.04 | 5.4 | 69.8 | 4 | 36.9 | |
| Qwen3-8BMode=Thinking2026.04 | 5.3 | 60.8 | 35.6 | 48.2 | |
| Qwen3-4B-Thinking-2507Mode=Thinking2026.04 | 2.7 | 57.9 | 19 | 38.4 | |
| GPT-5 miniMode=Thinking2026.04 | 2.4 | 69.8 | 48.9 | 59.3 | |
| Qwen3-1.7BMode=Thinking2026.04 | 1.7 | 50.9 | 19.3 | 35.1 | |
| Qwen3-1.7BMode=Non-Thinking2026.04 | 0.7 | 44.9 | 19.7 | 32.3 |