Question Answering on TQA (PRR)
86.1PRROurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursLLM Model=Qwen2.5-14B2026.03 | 86.1 | |
| OursLLM Model=Qwen2.5-7B2026.03 | 85.5 | |
| OursLLM Model=Mistral-7B2026.03 | 85.4 | |
| CCPLLM Model=Mistral-7B2026.03 | 84.2 | |
| CCPLLM Model=Qwen2.5-7B2026.03 | 83.9 | |
| OursLLM Model=Llama-3-8B2026.03 | 83.6 | |
| PerplexityLLM Model=Qwen2.5-7B2026.03 | 83.4 | |
| SARLLM Model=Mistral-7B2026.03 | 83.2 | |
| CCPLLM Model=Qwen2.5-14B2026.03 | 82.8 | |
| PerplexityLLM Model=Qwen2.5-14B2026.03 | 82.7 | |
| LN EntropyLLM Model=Qwen2.5-7B2026.03 | 82.6 | |
| sentenceSARLLM Model=Qwen2.5-7B2026.03 | 82.5 | |
| SARLLM Model=Qwen2.5-14B2026.03 | 82.5 | |
| SARLLM Model=Qwen2.5-7B2026.03 | 82.3 | |
| OursLLM Model=Llama-2-7B2026.03 | 82.3 | |
| PerplexityLLM Model=Mistral-7B2026.03 | 82.2 | |
| sentenceSARLLM Model=Qwen2.5-14B2026.03 | 82.2 | |
| Predictive EntropyLLM Model=Qwen2.5-7B2026.03 | 82.1 | |
| LN EntropyLLM Model=Mistral-7B2026.03 | 82 | |
| SARLLM Model=Llama-3-8B2026.03 | 82 | |
| LN EntropyLLM Model=Qwen2.5-14B2026.03 | 81.9 | |
| sentenceSARLLM Model=Mistral-7B2026.03 | 81.9 | |
| Predictive EntropyLLM Model=Qwen2.5-14B2026.03 | 81.7 | |
| CCPLLM Model=Llama-3-8B2026.03 | 81.4 | |
| Predictive EntropyLLM Model=Mistral-7B2026.03 | 81.2 | |
| PerplexityLLM Model=Llama-3-8B2026.03 | 81.1 | |
| P(True)LLM Model=Qwen2.5-14B2026.03 | 81 | |
| LN EntropyLLM Model=Llama-3-8B2026.03 | 80.7 | |
| tokenSARLLM Model=Qwen2.5-14B2026.03 | 80.6 | |
| SARLLM Model=Llama-2-7B2026.03 | 80.6 | |
| CCPLLM Model=Llama-2-7B2026.03 | 80.6 | |
| PerplexityLLM Model=Llama-2-7B2026.03 | 80.5 | |
| tokenSARLLM Model=Qwen2.5-7B2026.03 | 80.5 | |
| sentenceSARLLM Model=Llama-3-8B2026.03 | 80.4 | |
| tokenSARLLM Model=Mistral-7B2026.03 | 80.3 | |
| OursLLM Model=Qwen2.5-3B2026.03 | 79.9 | |
| Predictive EntropyLLM Model=Llama-3-8B2026.03 | 79.7 | |
| LN EntropyLLM Model=Llama-2-7B2026.03 | 79.7 | |
| tokenSARLLM Model=Llama-3-8B2026.03 | 79.5 | |
| sentenceSARLLM Model=Llama-2-7B2026.03 | 79.4 | |
| Predictive EntropyLLM Model=Llama-2-7B2026.03 | 78.9 | |
| tokenSARLLM Model=Llama-2-7B2026.03 | 78.5 | |
| CCPLLM Model=Qwen2.5-3B2026.03 | 77.9 | |
| sentenceSARLLM Model=Qwen2.5-3B2026.03 | 77.2 | |
| PerplexityLLM Model=Qwen2.5-3B2026.03 | 76.8 | |
| Predictive EntropyLLM Model=Qwen2.5-3B2026.03 | 76.7 | |
| LN EntropyLLM Model=Qwen2.5-3B2026.03 | 76.7 | |
| SARLLM Model=Qwen2.5-3B2026.03 | 76.4 | |
| P(True)LLM Model=Qwen2.5-7B2026.03 | 73.9 | |
| tokenSARLLM Model=Qwen2.5-3B2026.03 | 72.6 | |
| EigVLLM Model=Qwen2.5-7B2026.03 | 69.3 | |
| DegLLM Model=Qwen2.5-7B2026.03 | 69.2 | |
| EigVLLM Model=Mistral-7B2026.03 | 69.1 | |
| EigVLLM Model=Llama-3-8B2026.03 | 68.3 | |
| DegLLM Model=Mistral-7B2026.03 | 68.1 | |
| EigVLLM Model=Qwen2.5-14B2026.03 | 67.7 | |
| DegLLM Model=Qwen2.5-14B2026.03 | 67.5 | |
| Semantic EntropyLLM Model=Mistral-7B2026.03 | 67.3 | |
| Semantic EntropyLLM Model=Qwen2.5-14B2026.03 | 67.1 | |
| Eigen ScoreLLM Model=Qwen2.5-7B2026.03 | 67.1 | |
| Semantic EntropyLLM Model=Qwen2.5-7B2026.03 | 66.9 | |
| EigVLLM Model=Llama-2-7B2026.03 | 66.8 | |
| EccLLM Model=Mistral-7B2026.03 | 66.4 | |
| EigVLLM Model=Qwen2.5-3B2026.03 | 66 | |
| DegLLM Model=Llama-3-8B2026.03 | 65.9 | |
| Semantic EntropyLLM Model=Llama-2-7B2026.03 | 65.3 | |
| DegLLM Model=Llama-2-7B2026.03 | 65.3 | |
| DegLLM Model=Qwen2.5-3B2026.03 | 65.3 | |
| Semantic EntropyLLM Model=Llama-3-8B2026.03 | 65.1 | |
| Eigen ScoreLLM Model=Qwen2.5-3B2026.03 | 64.6 | |
| EccLLM Model=Qwen2.5-7B2026.03 | 64.5 | |
| Semantic EntropyLLM Model=Qwen2.5-3B2026.03 | 64.4 | |
| EccLLM Model=Qwen2.5-14B2026.03 | 63.9 | |
| Eigen ScoreLLM Model=Qwen2.5-14B2026.03 | 63.7 | |
| EccLLM Model=Llama-3-8B2026.03 | 63.5 | |
| EccLLM Model=Qwen2.5-3B2026.03 | 62.5 | |
| EccLLM Model=Llama-2-7B2026.03 | 62.2 | |
| Eigen ScoreLLM Model=Llama-3-8B2026.03 | 61.4 | |
| Eigen ScoreLLM Model=Llama-2-7B2026.03 | 58.4 | |
| Eigen ScoreLLM Model=Mistral-7B2026.03 | 57.9 | |
| P(True)LLM Model=Qwen2.5-3B2026.03 | 52.1 | |
| ConULLM Model=Qwen2.5-7B2026.03 | 51.2 | |
| ConULLM Model=Llama-2-7B2026.03 | 51 | |
| ConULLM Model=Mistral-7B2026.03 | 50.4 | |
| ConULLM Model=Llama-3-8B2026.03 | 49.8 | |
| ConULLM Model=Qwen2.5-14B2026.03 | 49.1 | |
| ConULLM Model=Qwen2.5-3B2026.03 | 43.2 | |
| P(True)LLM Model=Llama-3-8B2026.03 | 38.7 | |
| P(True)LLM Model=Mistral-7B2026.03 | 20.3 | |
| P(True)LLM Model=Llama-2-7B2026.03 | 7 |