Open-ended Text Generation on WikiText
54.83Rep-2ϵ-sampling + VCM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| ϵ-sampling + VCMBackbone=Qwen3-8B, Sampling Strategy=ϵ-sampling, VCM (Vector-based Confidence Masking)=True2026.06 | 54.83 | 27.08 | 15.36 | 47.41 | 0.59 | 0.52 | — | |
| η-sampling + VCMBackbone=Qwen3-8B, Sampling Strategy=η-sampling, VCM (Vector-based Confidence Masking)=True2026.06 | 55.22 | 26.99 | 14.56 | 47.43 | 0.59 | 0.46 | — | |
| Top-k + VCMBackbone=Qwen3-8B, Sampling Strategy=Top-k, VCM (Vector-based Confidence Masking)=True2026.06 | 55.71 | 26.75 | 16.32 | 47.27 | 0.59 | 0.53 | — | |
| Top-p + VCMBackbone=Qwen3-8B, Sampling Strategy=Top-p, VCM (Vector-based Confidence Masking)=True2026.06 | 58.89 | 40.44 | 14.71 | 46.97 | 0.56 | 0.51 | — | |
| Top-nσ + VCMBackbone=Qwen3-8B, Sampling Strategy=Top-nσ, VCM (Vector-based Confidence Masking)=True2026.06 | 59.03 | 25.13 | 13.94 | 46.93 | 0.51 | 0.49 | — | |
| Typical + VCMBackbone=Qwen3-8B, Sampling Strategy=Typical, VCM (Vector-based Confidence Masking)=True2026.06 | 59.79 | 24.69 | 14.36 | 46.76 | 0.62 | 0.55 | — | |
| Min-p + VCMBackbone=Qwen3-8B, Sampling Strategy=Min-p, VCM (Vector-based Confidence Masking)=True2026.06 | 61.69 | 23.82 | 14.4 | 46.73 | 0.59 | 0.46 | — | |
| p-less-norm + VCMBackbone=Qwen3-8B, Sampling Strategy=p-less-norm, VCM (Vector-based Confidence Masking)=True2026.06 | 69.68 | 20.01 | 10.06 | 45.36 | 0.49 | 0.53 | — | |
| Min-k + VCMBackbone=Qwen3-8B, Sampling Strategy=Min-k, VCM (Vector-based Confidence Masking)=True2026.06 | 75.74 | 21.09 | 12.68 | 45.97 | 0.5 | 0.46 | — | |
| η-samplingBackbone=Qwen3-8B, Sampling Strategy=η-sampling, VCM (Vector-based Confidence Masking)=False2026.06 | 78.8 | 12.37 | 2.46 | 43.25 | 0.21 | 0.23 | 0.53 | |
| ϵ-samplingBackbone=Qwen3-8B, Sampling Strategy=ϵ-sampling, VCM (Vector-based Confidence Masking)=False2026.06 | 79.03 | 12.34 | 3.47 | 43.19 | 0.26 | 0.24 | 0.62 | |
| Top-kBackbone=Qwen3-8B, Sampling Strategy=Top-k, VCM (Vector-based Confidence Masking)=False2026.06 | 79.78 | 12.17 | 2.77 | 43.14 | 0.24 | 0.26 | 0.55 | |
| Top-pBackbone=Qwen3-8B, Sampling Strategy=Top-p, VCM (Vector-based Confidence Masking)=False2026.06 | 80.59 | 17.49 | 2.81 | 42.8 | 0.26 | 0.22 | 0.59 | |
| TypicalBackbone=Qwen3-8B, Sampling Strategy=Typical, VCM (Vector-based Confidence Masking)=False2026.06 | 81.2 | 10.82 | 2.23 | 42.48 | 0.19 | 0.16 | 0.51 | |
| Min-pBackbone=Qwen3-8B, Sampling Strategy=Min-p, VCM (Vector-based Confidence Masking)=False2026.06 | 82.7 | 10.3 | 1.71 | 41.98 | 0.23 | 0.28 | 0.56 | |
| Top-nσBackbone=Qwen3-8B, Sampling Strategy=Top-nσ, VCM (Vector-based Confidence Masking)=False2026.06 | 82.74 | 10.32 | 1.91 | 42.14 | 0.26 | 0.21 | 0.53 | |
| p-less-normBackbone=Qwen3-8B, Sampling Strategy=p-less-norm, VCM (Vector-based Confidence Masking)=False2026.06 | 85.87 | 8.72 | 1.24 | 41.17 | 0.22 | 0.15 | 0.63 | |
| Min-kBackbone=Qwen3-8B, Sampling Strategy=Min-k, VCM (Vector-based Confidence Masking)=False2026.06 | 85.98 | 8.66 | 1.27 | 41.1 | 0.23 | 0.17 | 0.61 |