Mathematical Reasoning on Internal Benchmark
65.5Average ScoreOST (Top-50%)
Evaluation Results
| Method | Links | |
|---|---|---|
| OST (Top-50%)Selection Resource=16 × H100 (Block-wise), Selection Time=4.4h†, Training Resource=64 × H100, Training Data Size=175.6k, Training Epochs=1, Training Time=2.4h2026.05 | 65.5 | |
| LLM-as-a-JudgeSelection Resource=API, 0 GPU (3 Rounds), Selection Time=5.0h†, Training Resource=64 × H100, Training Data Size=285.2k, Training Epochs=1, Training Time=4.2h2026.05 | 63.7 | |
| OST (Top-20%)Selection Resource=16 × H100 (Block-wise), Selection Time=4.4h†, Training Resource=64 × H100, Training Data Size=70.2k, Training Epochs=1, Training Time=0.9h2026.05 | 62.9 | |
| OST (Top-30%)Selection Resource=16 × H100 (Block-wise), Selection Time=4.4h†, Training Resource=64 × H100, Training Data Size=105.3k, Training Epochs=1, Training Time=1.5h2026.05 | 62.7 | |
| OST (Top-10%)Selection Resource=16 × H100 (Block-wise), Selection Time=4.4h†, Training Resource=64 × H100, Training Data Size=35.1k, Training Epochs=1, Training Time=0.5h2026.05 | 61.7 |