Math Reasoning on GSM-H (held-out)
57.54Accuracy (%)ENVISIONS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ENVISIONSBackbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 57.54 | 63.56 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 53.98 | 56.49 | |
| STaR + Env.Backbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 53.37 | 60.6 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 52.08 | 57.17 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 50.57 | 59.77 | |
| ENVISIONSBackbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 48.52 | 58.69 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 47.84 | 52.46 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 47.08 | 54.73 | |
| STaR + Env.Backbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 46.63 | 55.91 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 44.88 | 53.03 | |
| Self-RewardingBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 41.24 | 52.5 | |
| Self-RewardingBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 31.69 | 44.22 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (13B), Mode=few-shot2024.06 | 28.96 | 38.61 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (7B), Mode=few-shot2024.06 | 10.69 | 25.69 |