Math Reasoning on ASDiv (held-out)
75.52PerformanceENVISIONS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ENVISIONSBackbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 75.52 | 63.56 | |
| STaR + Env.Backbone=LLaMA2-Chat (13B), Approach=Env-guided Self-Training2024.06 | 74.76 | 60.6 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 74.05 | 57.17 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (13B), Approach=Distill-then-Finetune2024.06 | 73.52 | 56.49 | |
| Self-RewardingBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 71.37 | 52.5 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (13B), Approach=Reinforced Self-Training2024.06 | 70.94 | 59.77 | |
| Claude-2 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 69.85 | 53.03 | |
| ENVISIONSBackbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 69.8 | 58.69 | |
| GPT-4 + LLaMA2-ChatBackbone=LLaMA2-Chat (7B), Approach=Distill-then-Finetune2024.06 | 68.75 | 52.46 | |
| STaR + Env.Backbone=LLaMA2-Chat (7B), Approach=Env-guided Self-Training2024.06 | 68.46 | 55.91 | |
| Iterative SFT+DPOBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 66.22 | 54.73 | |
| Self-RewardingBackbone=LLaMA2-Chat (7B), Approach=Reinforced Self-Training2024.06 | 61.55 | 44.22 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (13B), Mode=few-shot2024.06 | 46.61 | 38.61 | |
| LLaMA2-Chat (few-shot)Backbone=LLaMA2-Chat (7B), Mode=few-shot2024.06 | 25.86 | 25.69 |