Text Summarization Hallucination Evaluation on WikiSum
33AccuracyMEAP
Evaluation Results
| Method | Links | |
|---|---|---|
| MEAPTraining Objective=Mask-Enhanced Autoregressive Prediction, LLM Judge=Deepseek-V32025.02 | 33 | |
| MEAPTraining Objective=Mask-Enhanced Autoregressive Prediction, LLM Judge=Qwen-Plus2025.02 | 27 | |
| NTPTraining Objective=Next Token Prediction, LLM Judge=Deepseek-V32025.02 | 24 | |
| MEAPTraining Objective=Mask-Enhanced Autoregressive Prediction, LLM Judge=GPT-4o2025.02 | 24 | |
| NTPTraining Objective=Next Token Prediction, LLM Judge=Qwen-Plus2025.02 | 21 | |
| NTPTraining Objective=Next Token Prediction, LLM Judge=GPT-4o2025.02 | 19 |