Question Answering on NQ (PRR)
0.65PRROurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursLLM Model=Qwen2.5-7B2026.03 | 0.65 | |
| CCPLLM Model=Qwen2.5-7B2026.03 | 0.647 | |
| OursLLM Model=Qwen2.5-14B2026.03 | 0.645 | |
| CCPLLM Model=Qwen2.5-14B2026.03 | 0.643 | |
| OursLLM Model=Qwen2.5-3B2026.03 | 0.613 | |
| EigVLLM Model=Qwen2.5-7B2026.03 | 0.6 | |
| OursLLM Model=Llama-3-8B2026.03 | 0.599 | |
| SARLLM Model=Qwen2.5-7B2026.03 | 0.596 | |
| OursLLM Model=Mistral-7B2026.03 | 0.591 | |
| sentenceSARLLM Model=Qwen2.5-7B2026.03 | 0.586 | |
| Semantic EntropyLLM Model=Qwen2.5-7B2026.03 | 0.577 | |
| SARLLM Model=Qwen2.5-3B2026.03 | 0.574 | |
| Predictive EntropyLLM Model=Qwen2.5-7B2026.03 | 0.573 | |
| sentenceSARLLM Model=Llama-3-8B2026.03 | 0.573 | |
| sentenceSARLLM Model=Qwen2.5-14B2026.03 | 0.573 | |
| EigVLLM Model=Qwen2.5-3B2026.03 | 0.572 | |
| sentenceSARLLM Model=Qwen2.5-3B2026.03 | 0.571 | |
| SARLLM Model=Qwen2.5-14B2026.03 | 0.568 | |
| DegLLM Model=Qwen2.5-7B2026.03 | 0.567 | |
| CCPLLM Model=Qwen2.5-3B2026.03 | 0.565 | |
| Predictive EntropyLLM Model=Qwen2.5-14B2026.03 | 0.564 | |
| Predictive EntropyLLM Model=Llama-3-8B2026.03 | 0.563 | |
| Predictive EntropyLLM Model=Qwen2.5-3B2026.03 | 0.559 | |
| CCPLLM Model=Llama-3-8B2026.03 | 0.552 | |
| SARLLM Model=Llama-3-8B2026.03 | 0.548 | |
| sentenceSARLLM Model=Mistral-7B2026.03 | 0.546 | |
| CCPLLM Model=Mistral-7B2026.03 | 0.546 | |
| LN EntropyLLM Model=Qwen2.5-7B2026.03 | 0.545 | |
| EigVLLM Model=Llama-3-8B2026.03 | 0.545 | |
| Semantic EntropyLLM Model=Qwen2.5-3B2026.03 | 0.541 | |
| OursLLM Model=Llama-2-7B2026.03 | 0.541 | |
| DegLLM Model=Qwen2.5-3B2026.03 | 0.539 | |
| Predictive EntropyLLM Model=Mistral-7B2026.03 | 0.537 | |
| LN EntropyLLM Model=Qwen2.5-3B2026.03 | 0.536 | |
| EigVLLM Model=Qwen2.5-14B2026.03 | 0.534 | |
| SARLLM Model=Mistral-7B2026.03 | 0.531 | |
| Semantic EntropyLLM Model=Qwen2.5-14B2026.03 | 0.53 | |
| EigVLLM Model=Mistral-7B2026.03 | 0.521 | |
| LN EntropyLLM Model=Llama-3-8B2026.03 | 0.519 | |
| DegLLM Model=Llama-3-8B2026.03 | 0.516 | |
| LN EntropyLLM Model=Mistral-7B2026.03 | 0.514 | |
| PerplexityLLM Model=Qwen2.5-7B2026.03 | 0.513 | |
| CCPLLM Model=Llama-2-7B2026.03 | 0.513 | |
| P(True)LLM Model=Qwen2.5-7B2026.03 | 0.512 | |
| EccLLM Model=Qwen2.5-7B2026.03 | 0.512 | |
| sentenceSARLLM Model=Llama-2-7B2026.03 | 0.51 | |
| PerplexityLLM Model=Mistral-7B2026.03 | 0.508 | |
| SARLLM Model=Llama-2-7B2026.03 | 0.506 | |
| PerplexityLLM Model=Qwen2.5-3B2026.03 | 0.502 | |
| DegLLM Model=Mistral-7B2026.03 | 0.502 | |
| LN EntropyLLM Model=Qwen2.5-14B2026.03 | 0.501 | |
| Predictive EntropyLLM Model=Llama-2-7B2026.03 | 0.5 | |
| ConULLM Model=Qwen2.5-7B2026.03 | 0.499 | |
| Semantic EntropyLLM Model=Mistral-7B2026.03 | 0.497 | |
| Eigen ScoreLLM Model=Qwen2.5-7B2026.03 | 0.497 | |
| PerplexityLLM Model=Llama-3-8B2026.03 | 0.496 | |
| P(True)LLM Model=Qwen2.5-14B2026.03 | 0.495 | |
| DegLLM Model=Qwen2.5-14B2026.03 | 0.495 | |
| tokenSARLLM Model=Qwen2.5-14B2026.03 | 0.491 | |
| tokenSARLLM Model=Qwen2.5-7B2026.03 | 0.49 | |
| EccLLM Model=Qwen2.5-3B2026.03 | 0.488 | |
| tokenSARLLM Model=Qwen2.5-3B2026.03 | 0.483 | |
| EigVLLM Model=Llama-2-7B2026.03 | 0.481 | |
| Semantic EntropyLLM Model=Llama-3-8B2026.03 | 0.48 | |
| EccLLM Model=Qwen2.5-14B2026.03 | 0.477 | |
| EccLLM Model=Llama-3-8B2026.03 | 0.473 | |
| Eigen ScoreLLM Model=Qwen2.5-3B2026.03 | 0.464 | |
| LN EntropyLLM Model=Llama-2-7B2026.03 | 0.462 | |
| DegLLM Model=Llama-2-7B2026.03 | 0.461 | |
| PerplexityLLM Model=Qwen2.5-14B2026.03 | 0.46 | |
| Semantic EntropyLLM Model=Llama-2-7B2026.03 | 0.46 | |
| tokenSARLLM Model=Mistral-7B2026.03 | 0.455 | |
| EccLLM Model=Mistral-7B2026.03 | 0.455 | |
| ConULLM Model=Qwen2.5-14B2026.03 | 0.451 | |
| tokenSARLLM Model=Llama-3-8B2026.03 | 0.446 | |
| PerplexityLLM Model=Llama-2-7B2026.03 | 0.442 | |
| Eigen ScoreLLM Model=Llama-3-8B2026.03 | 0.439 | |
| EccLLM Model=Llama-2-7B2026.03 | 0.428 | |
| Eigen ScoreLLM Model=Qwen2.5-14B2026.03 | 0.421 | |
| tokenSARLLM Model=Llama-2-7B2026.03 | 0.415 | |
| ConULLM Model=Qwen2.5-3B2026.03 | 0.413 | |
| ConULLM Model=Mistral-7B2026.03 | 0.406 | |
| Eigen ScoreLLM Model=Llama-2-7B2026.03 | 0.406 | |
| Eigen ScoreLLM Model=Mistral-7B2026.03 | 0.395 | |
| P(True)LLM Model=Qwen2.5-3B2026.03 | 0.383 | |
| ConULLM Model=Llama-2-7B2026.03 | 0.381 | |
| ConULLM Model=Llama-3-8B2026.03 | 0.376 | |
| P(True)LLM Model=Llama-3-8B2026.03 | 0.153 | |
| P(True)LLM Model=Llama-2-7B2026.03 | 0.111 | |
| P(True)LLM Model=Mistral-7B2026.03 | -0.058 |