Self-evaluation on CVBench (AUROC)
0.747AUROCVAUQ
Evaluation Results
| Method | Links | |
|---|---|---|
| VAUQBackbone=InternVL3.5-8B2026.02 | 0.747 | |
| Semantic EntropyBackbone=InternVL3.5-8B2026.02 | 0.737 | |
| VAUQModel=LLaVA-1.5-7B2026.02 | 0.732 | |
| VL-UncertaintyBackbone=InternVL3.5-8B2026.02 | 0.72 | |
| VL-UncertaintyModel=LLaVA-1.5-7B2026.02 | 0.711 | |
| Semantic EntropyModel=LLaVA-1.5-7B2026.02 | 0.702 | |
| VAUQBackbone=Qwen-2.5-VL-7B2026.02 | 0.698 | |
| VL-UncertaintyBackbone=Qwen-2.5-VL-7B2026.02 | 0.697 | |
| VAUQModel=LLaVA-1.5-13B2026.02 | 0.683 | |
| VL-UncertaintyModel=LLaVA-1.5-13B2026.02 | 0.679 | |
| PerplexityBackbone=InternVL3.5-8B2026.02 | 0.664 | |
| Semantic EntropyModel=LLaVA-1.5-13B2026.02 | 0.662 | |
| EigenScoreModel=LLaVA-1.5-7B2026.02 | 0.658 | |
| PerplexityBackbone=Qwen-2.5-VL-7B2026.02 | 0.648 | |
| PerplexityModel=LLaVA-1.5-13B2026.02 | 0.646 | |
| SVARBackbone=Qwen-2.5-VL-7B2026.02 | 0.616 | |
| EigenScoreBackbone=InternVL3.5-8B2026.02 | 0.61 | |
| PerplexityModel=LLaVA-1.5-7B2026.02 | 0.603 | |
| VerbalizedBackbone=InternVL3.5-8B2026.02 | 0.601 | |
| Contextual LensModel=LLaVA-1.5-13B2026.02 | 0.586 | |
| EigenScoreModel=LLaVA-1.5-13B2026.02 | 0.581 | |
| VerbalizedModel=LLaVA-1.5-7B2026.02 | 0.576 | |
| VerbalizedBackbone=Qwen-2.5-VL-7B2026.02 | 0.563 | |
| VerbalizedModel=LLaVA-1.5-13B2026.02 | 0.554 | |
| Contextual LensBackbone=Qwen-2.5-VL-7B2026.02 | 0.544 | |
| Chain-of-EmbeddingsBackbone=InternVL3.5-8B2026.02 | 0.536 | |
| Chain-of-EmbeddingsModel=LLaVA-1.5-13B2026.02 | 0.533 | |
| Contextual LensModel=LLaVA-1.5-7B2026.02 | 0.511 | |
| EigenScoreBackbone=Qwen-2.5-VL-7B2026.02 | 0.509 | |
| Semantic EntropyBackbone=Qwen-2.5-VL-7B2026.02 | 0.509 | |
| Chain-of-EmbeddingsModel=LLaVA-1.5-7B2026.02 | 0.506 | |
| SVARBackbone=InternVL3.5-8B2026.02 | 0.505 | |
| Chain-of-EmbeddingsBackbone=Qwen-2.5-VL-7B2026.02 | 0.497 | |
| SVARModel=LLaVA-1.5-13B2026.02 | 0.492 | |
| SVARModel=LLaVA-1.5-7B2026.02 | 0.487 | |
| Contextual LensBackbone=InternVL3.5-8B2026.02 | 0.482 |