Long-form reasoning on Alpaca
-1.5772Avg LogProb per AnswerProbability
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ProbabilityBackbone=Llama 3B, Reward algorithm=Probability2026.02 | -1.5772 | 4.84 | -1.5724 | 58.6 | |
| Base modelBackbone=Qwen 3B, Reward algorithm=Base model2026.02 | -1.3968 | 4.04 | — | 83.7 | |
| Base modelBackbone=Llama 3B, Reward algorithm=Base model2026.02 | -1.3493 | 3.85 | — | 134.2 | |
| ProbabilityBackbone=Qwen 3B, Reward algorithm=Probability2026.02 | -1.2982 | 3.66 | -1.2955 | 16.6 | |
| Avg ProbabilityBackbone=Llama 3B, Reward algorithm=Avg Probability2026.02 | -0.9513 | 2.59 | -0.9512 | 9.1 | |
| Avg LogprobBackbone=Llama 3B, Reward algorithm=Avg Logprob2026.02 | -0.9449 | 2.57 | -0.9449 | 14.1 | |
| JEPOBackbone=Llama 3B, Reward algorithm=JEPO2026.02 | -0.9443 | 2.57 | -0.9436 | 14.8 | |
| Log-probBackbone=Llama 3B, Reward algorithm=Log-prob2026.02 | -0.9397 | 2.56 | -0.9396 | 14.2 | |
| SFT (no CoT)Backbone=Llama 3B, Reward algorithm=SFT (no CoT)2026.02 | -0.9381 | 2.56 | -0.9381 | 5 | |
| Avg ProbabilityBackbone=Qwen 3B, Reward algorithm=Avg Probability2026.02 | -0.8989 | 2.46 | -0.8988 | 15.2 | |
| JEPOBackbone=Qwen 3B, Reward algorithm=JEPO2026.02 | -0.8976 | 2.45 | -0.8969 | 16.6 | |
| Avg LogprobBackbone=Qwen 3B, Reward algorithm=Avg Logprob2026.02 | -0.8933 | 2.44 | -0.8931 | 14.3 | |
| SFT (no CoT)Backbone=Qwen 3B, Reward algorithm=SFT (no CoT)2026.02 | -0.8905 | 2.44 | -0.8905 | 5 | |
| Log-probBackbone=Qwen 3B, Reward algorithm=Log-prob2026.02 | -0.8903 | 2.44 | -0.8902 | 16.7 |