Mathematical Reasoning on NUMGLUE
76.4AccuracyS2L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| S2LTarget Model=Phi-3-Mini (3.8B), Fine-tuning Data=50%, Evaluation Protocol=Zero-shot2024.03 | 76.4 | — | |
| Full TrainingTarget Model=Phi-3-Mini (3.8B), Fine-tuning Data=100%, Evaluation Protocol=Zero-shot2024.03 | 75.3 | — | |
| UniPROTSelection Protocol=source-wise2026.04 | 68.8 | — | |
| GREATSSelection Protocol=source-wise2026.04 | 67.46 | — | |
| UniPROTSelection Protocol=batch-wise2026.04 | 66.02 | — | |
| S2LTarget Model=Llama-2-7B, Fine-tuning Data=50%, Evaluation Protocol=Zero-shot2024.03 | 65 | — | |
| GREATSSelection Protocol=batch-wise2026.04 | 64.4 | — | |
| COLMSelection Protocol=source-wise2026.04 | 64.11 | — | |
| GradNormSelection Protocol=batch-wise2026.04 | 64.1 | — | |
| COLMSelection Protocol=batch-wise2026.04 | 64.1 | — | |
| GradNormSelection Protocol=source-wise2026.04 | 64.01 | — | |
| FTBase Model=PHI-32026.04 | 62.57 | — | |
| IWDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 61.15 | — | |
| GradNormBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 60.84 | — | |
| Full TrainingTarget Model=Llama-2-7B, Fine-tuning Data=262K, Evaluation Protocol=Zero-shot2024.03 | 60.5 | — | |
| SBERTSelection Protocol=source-wise2026.04 | 60.26 | — | |
| PartitionSelBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 59.98 | — | |
| COLMBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 59.88 | — | |
| IDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 59.6 | — | |
| MaxLossSelection Protocol=batch-wise2026.04 | 58.9 | — | |
| GREATSBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 58.73 | — | |
| MaxLossSelection Protocol=source-wise2026.04 | 57.8 | — | |
| SBERTSelection Protocol=batch-wise2026.04 | 57.6 | — | |
| RandomBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 57.04 | — | |
| LoRABackbone=Llama 3-8B2026.05 | 56.9 | — | |
| ChunkFTBackbone=Llama 3-8B2026.05 | 56.4 | — | |
| APOLLOBackbone=Llama 3-8B2026.05 | 55.6 | — | |
| AdamBackbone=Llama 3-8B2026.05 | 55.4 | — | |
| HiFTBackbone=Llama 3-8B2026.05 | 54.5 | — | |
| GREATSSelection Strategy=batch-wise2026.04 | 54.1 | — | |
| BAdamBackbone=Llama 3-8B2026.05 | 53 | — | |
| PretrainedTarget Model=Phi-3-Mini (3.8B), Evaluation Protocol=Zero-shot2024.03 | 52.1 | — | |
| SBERTSelection Strategy=source-wise2026.04 | 52.01 | — | |
| UniPROTSelection Strategy=batch-wise2026.04 | 51.7 | — | |
| UniPROTSelection Strategy=source-wise2026.04 | 51.61 | — | |
| GradNormSelection Strategy=source-wise2026.04 | 51.3 | — | |
| GREATSSelection Strategy=source-wise2026.04 | 51.2 | — | |
| COLMSelection Strategy=source-wise2026.04 | 51.05 | — | |
| COLMSelection Strategy=batch-wise2026.04 | 50.8 | — | |
| GradNormSelection Strategy=batch-wise2026.04 | 50.6 | — | |
| SBERTSelection Strategy=batch-wise2026.04 | 48.4 | — | |
| FT2026.04 | 47.88 | — | |
| PartitionSelBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 43.95 | — | |
| PartitionSelBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 43.95 | — | |
| IDBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 41.27 | — | |
| IDBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 41.27 | — | |
| COLMBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 38 | — | |
| COLMBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 38 | — | |
| LOMOBackbone=Llama 3-8B2026.05 | 37.1 | — | |
| GaloreBackbone=Llama 3-8B2026.05 | 36.9 | — | |
| GradNormBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 36.85 | — | |
| GradNormBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 36.85 | — | |
| VanillaBackbone=Llama 3-8B2026.05 | 34.5 | — | |
| PretrainedTarget Model=Llama-2-7B, Evaluation Protocol=Zero-shot2024.03 | 16.5 | — | |
| Full-data Fine-tuningBackbone=LLAMA-2-7B, Coreset Method=Full-data, Coreset Fraction=100%2025.10 | — | 59.34 | |
| LESSBackbone=LLAMA-2-7B, Coreset Method=LESS, Coreset Fraction=50%2025.10 | — | 60.3 | |
| Pretrained (no Fine-tuning)Backbone=LLAMA-2-7B, Coreset Method=Pretrained2025.10 | — | 16.5 | |
| RandomBackbone=LLAMA-2-7B, Coreset Method=Random, Coreset Fraction=50%2025.10 | — | 55.12 | |
| S2LBackbone=LLAMA-2-7B, Coreset Method=S2L, Coreset Fraction=50%2025.10 | — | 60.1 | |
| TAGCOSBackbone=LLAMA-2-7B, Coreset Method=TAGCOS, Coreset Fraction=50%2025.10 | — | 58.31 | |
| TRIMBackbone=LLAMA-2-7B, Coreset Method=TRIM, Coreset Fraction=50%2025.10 | — | 60.52 |