Hallucination Evaluation on A-HaluEval
91.5A-AccuracyMulti-DPOP
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi-DPOPModel=Qwen3-30B2025.10 | 91.5 | |
| Qwen3-30BTraining Variant=M-DPOP2025.10 | 91.5 | |
| Multi-DPOPModel=Qwen3-4B2025.10 | 86.5 | |
| Qwen3-4BTraining Variant=M-DPOP2025.10 | 86.5 | |
| Multi-DPOPModel=Tulu-3.1-8B2025.10 | 85 | |
| Tulu-3.1-8BTraining Variant=M-DPOP2025.10 | 85 | |
| Multi-DPOPModel=GLM-4-9B2025.10 | 84 | |
| GLM-4-9BTraining Variant=M-DPOP2025.10 | 84 | |
| Multi-DPOPModel=Gemma-3-4B2025.10 | 82.5 | |
| Gemma-3-4BTraining Variant=M-DPOP2025.10 | 82.5 | |
| GRPOModel=Qwen3-30B2025.10 | 61.4 | |
| Qwen3-30BTraining Variant=GRPO2025.10 | 61.4 | |
| DPOModel=Qwen3-30B2025.10 | 60.2 | |
| GRPOModel=Qwen3-4B2025.10 | 59.3 | |
| Qwen3-4BTraining Variant=GRPO2025.10 | 59.3 | |
| SFTModel=Qwen3-30B2025.10 | 58.9 | |
| GRPOModel=Tulu-3.1-8B2025.10 | 58.3 | |
| Tulu-3.1-8BTraining Variant=GRPO2025.10 | 58.3 | |
| DPOModel=Qwen3-4B2025.10 | 58 | |
| BaseModel=Qwen3-30B2025.10 | 57.6 | |
| Qwen3-30BTraining Variant=Base2025.10 | 57.6 | |
| GRPOModel=GLM-4-9B2025.10 | 57.4 | |
| GLM-4-9BTraining Variant=GRPO2025.10 | 57.4 | |
| DPOModel=Tulu-3.1-8B2025.10 | 57.1 | |
| SFTModel=Qwen3-4B2025.10 | 56.4 | |
| DPOModel=GLM-4-9B2025.10 | 56.3 | |
| GRPOModel=Gemma-3-4B2025.10 | 56.1 | |
| Gemma-3-4BTraining Variant=GRPO2025.10 | 56.1 | |
| SFTModel=Tulu-3.1-8B2025.10 | 55.8 | |
| DPOModel=Gemma-3-4B2025.10 | 55.2 | |
| BaseModel=Qwen3-4B2025.10 | 55.2 | |
| Qwen3-4BTraining Variant=Base2025.10 | 55.2 | |
| SFTModel=GLM-4-9B2025.10 | 54.9 | |
| BaseModel=Tulu-3.1-8B2025.10 | 54.7 | |
| Tulu-3.1-8BTraining Variant=Base2025.10 | 54.7 | |
| BaseModel=GLM-4-9B2025.10 | 53.8 | |
| GLM-4-9BTraining Variant=Base2025.10 | 53.8 | |
| SFTModel=Gemma-3-4B2025.10 | 53.5 | |
| BaseModel=Gemma-3-4B2025.10 | 52.3 | |
| Gemma-3-4BTraining Variant=Base2025.10 | 52.3 |