Certifiable Acceptance Length Estimation on Qwen3-4B
100Mean Certifiable Acceptance LengthAdditive
Evaluation Results
| Method | Links | |
|---|---|---|
| Additivet=0.3, training KL bound epsilon=0.012026.06 | 100 | |
| Mult.alpha=0.5, training KL bound epsilon=0.012026.06 | 100 | |
| Mult.alpha=0.1, training KL bound epsilon=0.012026.06 | 100 | |
| Mult.alpha=0.1, training KL bound epsilon=0.052026.06 | 100 | |
| Mult.alpha=0.1, training KL bound epsilon=0.102026.06 | 100 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.012026.06 | 100 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.052026.06 | 100 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.102026.06 | 100 | |
| Treem=4, training KL bound epsilon=0.012026.06 | 100 | |
| Treem=8, training KL bound epsilon=0.012026.06 | 100 | |
| Treem=8, training KL bound epsilon=0.052026.06 | 100 | |
| Treem=8, training KL bound epsilon=0.102026.06 | 100 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.202026.06 | 99.57 | |
| Additivet=0.3, training KL bound epsilon=0.052026.06 | 98.09 | |
| Treem=4, training KL bound epsilon=0.052026.06 | 84.46 | |
| Mult.alpha=0.1, training KL bound epsilon=0.202026.06 | 74.15 | |
| Treem=8, training KL bound epsilon=0.202026.06 | 73.77 | |
| Treem=2, training KL bound epsilon=0.012026.06 | 64.57 | |
| Treem=4, training KL bound epsilon=0.102026.06 | 54.05 | |
| Treem=8, training KL bound epsilon=0.302026.06 | 50.31 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.302026.06 | 45.57 | |
| Additivet=0.1, training KL bound epsilon=0.012026.06 | 36.13 | |
| Treem=8, training KL bound epsilon=0.402026.06 | 35.21 | |
| Mult.alpha=0.5, training KL bound epsilon=0.052026.06 | 34.21 | |
| Treem=4, training KL bound epsilon=0.202026.06 | 29.54 | |
| Treem=2, training KL bound epsilon=0.052026.06 | 28.39 | |
| Treem=8, training KL bound epsilon=0.502026.06 | 26.67 | |
| Additivet=0.3, training KL bound epsilon=0.102026.06 | 19.67 | |
| Treem=4, training KL bound epsilon=0.302026.06 | 19.03 | |
| Treem=2, training KL bound epsilon=0.102026.06 | 17.25 | |
| Mult.alpha=0.1, training KL bound epsilon=0.302026.06 | 16.24 | |
| Treem=8, training KL bound epsilon=0.692026.06 | 16.14 | |
| Treem=4, training KL bound epsilon=0.402026.06 | 13.82 | |
| Strict greedytraining KL bound epsilon=0.012026.06 | 13.65 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.402026.06 | 13.33 | |
| Mult.alpha=0.5, training KL bound epsilon=0.102026.06 | 10.44 | |
| Treem=4, training KL bound epsilon=0.502026.06 | 10.44 | |
| Treem=2, training KL bound epsilon=0.202026.06 | 10.24 | |
| Additivet=0.1, training KL bound epsilon=0.052026.06 | 9.69 | |
| Strict greedytraining KL bound epsilon=0.052026.06 | 7.42 | |
| Treem=2, training KL bound epsilon=0.302026.06 | 7.3 | |
| Treem=4, training KL bound epsilon=0.692026.06 | 6.65 | |
| Additivet=0.3, training KL bound epsilon=0.202026.06 | 6.39 | |
| Additivet=0.1, training KL bound epsilon=0.102026.06 | 6.38 | |
| Mult.alpha=0.1, training KL bound epsilon=0.402026.06 | 6.3 | |
| Strict greedytraining KL bound epsilon=0.102026.06 | 5.6 | |
| Mult.alpha=0.5, training KL bound epsilon=0.202026.06 | 5.32 | |
| Treem=2, training KL bound epsilon=0.402026.06 | 5.27 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.502026.06 | 5.06 | |
| Additivet=0.1, training KL bound epsilon=0.202026.06 | 4.31 | |
| Treem=2, training KL bound epsilon=0.502026.06 | 4.19 | |
| Strict greedytraining KL bound epsilon=0.202026.06 | 4.07 | |
| Additivet=0.3, training KL bound epsilon=0.302026.06 | 4.05 | |
| Mult.alpha=0.5, training KL bound epsilon=0.302026.06 | 3.78 | |
| Additivet=0.1, training KL bound epsilon=0.302026.06 | 3.4 | |
| Strict greedytraining KL bound epsilon=0.302026.06 | 3.31 | |
| Mult.alpha=0.1, training KL bound epsilon=0.502026.06 | 3.3 | |
| Treem=2, training KL bound epsilon=0.692026.06 | 3.16 | |
| Additivet=0.3, training KL bound epsilon=0.402026.06 | 3.07 | |
| Mult.alpha=0.5, training KL bound epsilon=0.402026.06 | 2.97 | |
| Additivet=0.1, training KL bound epsilon=0.402026.06 | 2.84 | |
| Strict greedytraining KL bound epsilon=0.402026.06 | 2.81 | |
| Additivet=0.3, training KL bound epsilon=0.502026.06 | 2.51 | |
| Mult.alpha=0.5, training KL bound epsilon=0.502026.06 | 2.45 | |
| Strict greedytraining KL bound epsilon=0.502026.06 | 2.44 | |
| Additivet=0.1, training KL bound epsilon=0.502026.06 | 2.44 | |
| Medusaepsilon_0=0.1, delta_0=0.09, training KL bound epsilon=0.692026.06 | 1.55 | |
| Mult.alpha=0.1, training KL bound epsilon=0.692026.06 | 1.49 | |
| Additivet=0.3, training KL bound epsilon=0.692026.06 | 1.48 | |
| Strict greedytraining KL bound epsilon=0.692026.06 | 1.47 | |
| Additivet=0.1, training KL bound epsilon=0.692026.06 | 1.47 | |
| Mult.alpha=0.5, training KL bound epsilon=0.692026.06 | 1.47 |