Text Quality Meta-evaluation on Topical-Chat (Local)
0.831UnderstandabilityGPT-4o mini
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4o mini2025.02 | 0.831 | 0.717 | 0.783 | 0.683 | 0.621 | 0.727 | |
| CompassJudger-32B2025.02 | 0.795 | 0.679 | 0.783 | 0.652 | 0.586 | 0.699 | |
| Qwen-2.5-72B2025.02 | 0.781 | 0.61 | 0.821 | 0.633 | 0.612 | 0.691 | |
| Gemma-2-27B2025.02 | 0.781 | 0.745 | 0.66 | 0.705 | 0.531 | 0.684 | |
| GPT-4o2025.02 | 0.776 | 0.714 | 0.807 | 0.702 | 0.595 | 0.719 | |
| Phi-4-14B2025.02 | 0.774 | 0.624 | 0.726 | 0.643 | 0.55 | 0.663 | |
| GPT-4 Turbo2025.02 | 0.764 | 0.721 | 0.776 | 0.64 | 0.624 | 0.705 | |
| DeepSeek-V32025.02 | 0.75 | 0.731 | 0.814 | 0.681 | 0.662 | 0.728 | |
| Llama-3.1-70B2025.02 | 0.745 | 0.695 | 0.757 | 0.719 | 0.571 | 0.698 | |
| GPT-3.5 Turbo2025.02 | 0.7 | 0.617 | 0.698 | 0.69 | 0.555 | 0.652 | |
| Prometheus-2-8x7B2025.02 | 0.695 | 0.612 | 0.633 | 0.602 | 0.552 | 0.619 | |
| Prometheus-2-7B2025.02 | 0.688 | 0.6 | 0.669 | 0.621 | 0.593 | 0.634 | |
| CRITIQUELLM-6B2025.02 | 0.664 | 0.586 | 0.636 | 0.471 | 0.564 | 0.584 | |
| Themis-8B2025.02 | 0.588 | 0.462 | 0.543 | 0.443 | 0.357 | 0.479 | |
| Auto-J-13B2025.02 | 0.533 | 0.445 | 0.533 | 0.462 | 0.448 | 0.484 | |
| Prometheus-13B2025.02 | 0.433 | 0.54 | 0.343 | 0.557 | 0.49 | 0.473 |