Math Reasoning on SVAMP (held-out)
78.3PerformanceENVISIONS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ENVISIONSBackbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 78.3 | 63.56 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 77.3 | 59.77 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 76.3 | 57.17 | |
| STaR + Env.Backbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 74.7 | 60.6 | |
| Self-RewardingBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 74.1 | 52.5 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 73 | 56.49 | |
| ENVISIONSBackbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 72.4 | 58.69 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 70.5 | 53.03 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 70.1 | 54.73 | |
| STaR + Env.Backbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 67.5 | 55.91 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 66.8 | 52.46 | |
| Self-RewardingBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 58.2 | 44.22 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (13B), Mode=few-shot2024.06 | 45 | 38.61 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (7B), Mode=few-shot2024.06 | 22 | 25.69 |