Mathematical Reasoning on GSM8K, MATH, and NumGLUE (test)
69.1GSM8K AccuracyS2L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| S2LTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 69.1 | 32.6 | 65.7 | 55.8 | |
| Full-262KTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=262K2024.03 | 68.3 | 32.6 | 64.3 | 55.1 | |
| RandomTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 67.9 | 30.1 | 60.7 | 52.9 | |
| Middle PerplexityTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 66.4 | 29.5 | 54.1 | 50 | |
| Facility LocationsTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 66.2 | 31.3 | 62.4 | 53.3 | |
| Least ConfidenceTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 61.7 | 24.7 | 67 | 51.1 | |
| High LearnabilityTarget Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data Size=50K2024.03 | 59.4 | 25.2 | 62.1 | 48.9 | |
| Phi-2 (Pretrained)Target Model=Phi-2 (2.7B), Evaluation Protocol=Zero-shot, Fine-tuning Data=None2024.03 | 53.4 | 16.1 | 34.9 | 34.8 |