Vocabulary Difficulty Prediction on KVL data (test)
0.989PCC (Chinese)Statistical Optimum
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Statistical OptimumCategory=Upper Bound / Simulation2026.05 | 0.989 | 0.99 | 0.995 | 0.991 | |
| finetuned_llms_plusTrack=Open-track submission, Fine-tuning=Soft-target cross-entropy2026.05 | 0.928 | 0.915 | 0.919 | 0.921 | |
| open_maxTrack=Open-track submission, Fine-tuning=Soft-target cross-entropy2026.05 | 0.927 | 0.916 | 0.92 | 0.921 | |
| ≤32B LLM AverageModel Type=Ensemble2026.05 | 0.926 | 0.914 | 0.916 | 0.918 | |
| finetuned_llmsTrack=Open-track submission, Fine-tuning=Soft-target cross-entropy2026.05 | 0.925 | 0.914 | 0.915 | 0.918 | |
| ≤14B LLM AverageModel Type=Ensemble2026.05 | 0.921 | 0.905 | 0.908 | 0.911 | |
| GLM-4-32BModel Size=32B2026.05 | 0.918 | 0.907 | 0.906 | 0.91 | |
| Qwen2.5-32BModel Size=32B2026.05 | 0.917 | 0.902 | 0.907 | 0.909 | |
| ≤9B LLM AverageModel Type=Ensemble2026.05 | 0.916 | 0.901 | 0.9 | 0.906 | |
| Ministral-3-14BModel Size=14B2026.05 | 0.915 | 0.902 | 0.907 | 0.908 | |
| closed_maxtrack=closed-track2026.05 | 0.874 | 0.844 | 0.854 | 0.857 | |
| explainabletrack=closed-track2026.05 | 0.837 | 0.779 | 0.789 | 0.802 | |
| explainableinference_type=std. inference2026.05 | 0.82 | 0.768 | 0.776 | 0.788 | |
| explainableinference_type=lin. regression2026.05 | 0.815 | 0.766 | 0.769 | 0.783 | |
| Open-Track BaselineCategory=Shared Task Baseline2026.05 | 0.804 | 0.786 | 0.783 | 0.791 | |
| traditionaltrack=closed-track2026.05 | 0.767 | 0.747 | 0.721 | 0.745 | |
| Closed-Track Baselinetrack=closed-track2026.05 | 0.753 | 0.773 | 0.765 | 0.764 |