Hallucination Evaluation on HallB
54.2ScoreSAIL
Evaluation Results
| Method | Links | |
|---|---|---|
| SAILLLM=Mistral-7B, # Data=512M / 86M / 6M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 54.2 | |
| Qwen2.5-VLLLM=Qwen2.5-7B, # Data=- / - / -, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 52.9 | |
| Encoder-BasedLLM=Qwen3-8B, # Data=>6B / 40M / 4M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 51.4 | |
| Qwen2-VLLLM=Qwen2-7B, # Data=- / - / -, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 50.6 | |
| InternVL2.5LLM=InternLM2.5-7B, # Data=>6B / 50M / 4M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 50.1 | |
| InternVL3LLM=Qwen2.5-7B, # Data=>6B / 100M / 22M, Model Scale=8B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 49.9 | |
| NEOLLM=Qwen3-8B, # Data=345M / 40M / 4M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 46.4 | |
| Qwen2.5-VLLLM=Qwen2.5-3B, # Data=- / - / -, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 46.3 | |
| Encoder-BasedLLM=Qwen3-1.7B, # Data=>6B / 40M / 4M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 44.4 | |
| NEOLLM=Qwen3-1.7B, # Data=345M / 40M / 4M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 43.1 | |
| InternVL2.5LLM=InternLM2.5-1.8B, # Data=>6B / 100M / 16M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 42.6 | |
| InternVL3LLM=Qwen2.5-1.5B, # Data=>6B / 100M / 22M, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=true2025.10 | 42.5 | |
| Qwen2-VLLLM=Qwen2-1.5B, # Data=- / - / -, Model Scale=2B, Architecture Category=Modular, Reinforcement Learning=false2025.10 | 41.7 | |
| HoVLELLM=InternLM2-1.8B, # Data=550M / 50M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 38.4 | |
| BREENLLM=Qwen2.5-7B, # Data=13M / 0M / 4M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 37 | |
| Mono-InternVLLLM=InternLM2-1.8B, # Data=1.2B / 143M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 34.8 | |
| Mono-InternVL-1.5LLM=InternLM2-1.8B, # Data=400M / 150M / 7M, Model Scale=2B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 32.5 | |
| EVELLM=Vicuna-7B, # Data=33M / 0M / 1.8M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 26.4 | |
| ChameleonLLM=from scratch, # Data=1.4B / 0M / 1.8M, Model Scale=8B, Architecture Category=Native, Reinforcement Learning=false2025.10 | 17.1 |