Instruction Following on UltraFeedback (core250)
12.568Delta Preference Score (bo64)TEA
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| TEABudget=m = 64, Step=4252026.05 | 12.568 | 13.718 | 14.75 | 0.581 | 3.836 | 6.279 | 8.241 | 9.883 | 11.299 | |
| Prefix-TEABudget=m = 64, Step=4502026.05 | 12.403 | 13.59 | 14.548 | 0.401 | 3.639 | 6.071 | 8.031 | 9.686 | 11.105 | |
| GRPO-ZBudget=m = 64, Step=4502026.05 | 11.999 | 13.124 | 14.207 | 0.448 | 3.526 | 5.832 | 7.69 | 9.278 | 10.684 | |
| CAT-BoNBudget=m = 64, Step=4252026.05 | 11.395 | 12.482 | 13.484 | -0.8 | 2.593 | 5.095 | 7.083 | 8.757 | 10.158 | |
| BoN-max secondBudget=m = 64, Step=2502026.05 | 11.304 | 12.51 | 13.536 | -1.445 | 2.16 | 4.808 | 6.871 | 8.554 | 10.017 | |
| BoN-max meanBudget=m = 64, Step=1252026.05 | 11.052 | 12.207 | 13.291 | -1.603 | 1.93 | 4.552 | 6.61 | 8.31 | 9.743 | |
| BoN meanBudget=m = 64, k = 32, Step=2502026.05 | 11.047 | 12.193 | 13.233 | -1.633 | 1.901 | 4.534 | 6.609 | 8.295 | 9.717 | |
| GRPOBudget=m = 64, Step=1002026.05 | 11.033 | 12.149 | 13.273 | -1.129 | 2.226 | 4.719 | 6.731 | 8.398 | 9.803 | |
| BoN mean 2×Budget=m = 128, k = 64, Step=2752026.05 | 11.009 | 12.191 | 13.289 | -1.431 | 2.046 | 4.584 | 6.579 | 8.241 | 9.672 | |
| Chow BoN-RLBudget=m = 64, Step=2002026.05 | 10.903 | 12.013 | 13.19 | -1.716 | 1.843 | 4.45 | 6.496 | 8.183 | 9.637 | |
| TEAtraining rollout budget (m)=642026.05 | 1.535 | 1.569 | 1.477 | — | — | — | — | — | — | |
| Prefix-TEAtraining rollout budget (m)=642026.05 | 1.37 | 1.441 | 1.275 | — | — | — | — | — | — | |
| GRPO-Ztraining rollout budget (m)=642026.05 | 0.966 | 0.975 | 0.933 | — | — | — | — | — | — | |
| Best TTAtraining rollout budget (m)=64, note=Represents CAT-BoN at bo64 and BoN-max at bo128/bo2562026.05 | 0.362 | 0.361 | 0.263 | — | — | — | — | — | — | |
| BoN mean 2×training rollout budget (m)=1282026.05 | 0.024 | 0.043 | 0.016 | — | — | — | — | — | — |