Mathematical Reasoning on SIMULEQ
68.28AccuracyUniPROT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UniPROTSelection Protocol=batch-wise2026.04 | 68.28 | — | |
| UniPROTSelection Protocol=source-wise2026.04 | 66.73 | — | |
| GradNormSelection Protocol=batch-wise2026.04 | 65.7 | — | |
| COLMSelection Protocol=batch-wise2026.04 | 63.6 | — | |
| FTBase Model=PHI-32026.04 | 62.78 | — | |
| COLMSelection Protocol=source-wise2026.04 | 62.25 | — | |
| GREATSSelection Protocol=source-wise2026.04 | 62.06 | — | |
| GREATSSelection Protocol=batch-wise2026.04 | 61.92 | — | |
| GradNormSelection Protocol=source-wise2026.04 | 61.84 | — | |
| SBERTSelection Protocol=source-wise2026.04 | 61.7 | — | |
| SBERTSelection Protocol=batch-wise2026.04 | 58.9 | — | |
| MaxLossSelection Protocol=source-wise2026.04 | 57.19 | — | |
| MaxLossSelection Protocol=batch-wise2026.04 | 55.82 | — | |
| PartitionSelBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 54.67 | — | |
| IWDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 52.18 | — | |
| Full TrainingTarget Model=Phi-3-Mini (3.8B), Fine-tuning Data=100%, Evaluation Protocol=Zero-shot2024.03 | 51.9 | — | |
| S2LTarget Model=Phi-3-Mini (3.8B), Fine-tuning Data=50%, Evaluation Protocol=Zero-shot2024.03 | 51.6 | — | |
| GradNormBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 51.56 | — | |
| COLMBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 51.56 | — | |
| IDBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 51.17 | — | |
| RandomBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 50.27 | — | |
| Full TrainingTarget Model=Llama-2-7B, Fine-tuning Data=262K, Evaluation Protocol=Zero-shot2024.03 | 50.2 | — | |
| GREATSBackbone=Qwen2.5-3B, Fine-tuning Dataset=Meta-MathQA, Subset Fraction=50%2026.06 | 50 | — | |
| UniPROTSelection Strategy=source-wise2026.04 | 41.4 | — | |
| GradNormSelection Strategy=source-wise2026.04 | 40.6 | — | |
| GradNormSelection Strategy=batch-wise2026.04 | 38.13 | — | |
| GREATSSelection Strategy=source-wise2026.04 | 37.35 | — | |
| FT2026.04 | 36.7 | — | |
| SBERTSelection Strategy=source-wise2026.04 | 36.5 | — | |
| UniPROTSelection Strategy=batch-wise2026.04 | 35.6 | — | |
| GREATSSelection Strategy=batch-wise2026.04 | 35.01 | — | |
| PretrainedTarget Model=Phi-3-Mini (3.8B), Evaluation Protocol=Zero-shot2024.03 | 34.8 | — | |
| SBERTSelection Strategy=batch-wise2026.04 | 33.8 | — | |
| COLMSelection Strategy=source-wise2026.04 | 32.4 | — | |
| S2LTarget Model=Llama-2-7B, Fine-tuning Data=50%, Evaluation Protocol=Zero-shot2024.03 | 31.9 | — | |
| COLMSelection Strategy=batch-wise2026.04 | 31.9 | — | |
| PartitionSelBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 19.65 | — | |
| PartitionSelBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 19.65 | — | |
| IDBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 18.87 | — | |
| IDBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 18.87 | — | |
| COLMBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 17.12 | — | |
| COLMBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 17.12 | — | |
| GradNormBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 11.28 | — | |
| GradNormBackbone=Llama-3.1-8B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 11.28 | — | |
| PretrainedTarget Model=Llama-2-7B, Evaluation Protocol=Zero-shot2024.03 | 2.3 | — | |
| Full-data Fine-tuningBackbone=LLAMA-2-7B, Coreset Method=Full-data, Coreset Fraction=100%2025.10 | — | 49.5 | |
| LESSBackbone=LLAMA-2-7B, Coreset Method=LESS, Coreset Fraction=50%2025.10 | — | 48.75 | |
| Pretrained (no Fine-tuning)Backbone=LLAMA-2-7B, Coreset Method=Pretrained2025.10 | — | 2.3 | |
| RandomBackbone=LLAMA-2-7B, Coreset Method=Random, Coreset Fraction=50%2025.10 | — | 45.16 | |
| S2LBackbone=LLAMA-2-7B, Coreset Method=S2L, Coreset Fraction=50%2025.10 | — | 49.26 | |
| TAGCOSBackbone=LLAMA-2-7B, Coreset Method=TAGCOS, Coreset Fraction=50%2025.10 | — | 48.85 | |
| TRIMBackbone=LLAMA-2-7B, Coreset Method=TRIM, Coreset Fraction=50%2025.10 | — | 48.75 |