Math Reasoning on MATH (held-out)
26.04PerformanceENVISIONS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ENVISIONSBackbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 26.04 | 63.56 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 23.64 | 56.49 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 23.47 | 57.17 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 22.32 | 59.77 | |
| STaR + Env.Backbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 20.57 | 60.6 | |
| ENVISIONSBackbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 19 | 58.69 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 18.84 | 52.46 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 18.17 | 53.03 | |
| STaR + Env.Backbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 15.97 | 55.91 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 14.75 | 54.73 | |
| Self-RewardingBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 13.97 | 52.5 | |
| Self-RewardingBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 10.7 | 44.22 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (13B), Mode=few-shot2024.06 | 6.07 | 38.61 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (7B), Mode=few-shot2024.06 | 1.32 | 25.69 |