Math Reasoning on JEEBench
74.4AccuracyAPRM
Evaluation Results
| Method | Links | |
|---|---|---|
| APRMBackbone=Gemma-3-27B2025.11 | 74.4 | |
| APRMBackbone=Gemma-3-27B2025.11 | 74.4 | |
| APRMBackbone=GPT-OSS-20B2025.11 | 73 | |
| APRMBackbone=GPT-OSS-20B2025.11 | 73 | |
| APRMBackbone=GPT-OSS-120B2025.11 | 70.3 | |
| ReST-MCTSBackbone=Gemma-3-27B2025.11 | 70.3 | |
| APRMBackbone=GPT-OSS-120B2025.11 | 70.3 | |
| ReST-MCTSBackbone=Gemma-3-27B2025.11 | 70.3 | |
| rStar MathBackbone=Gemma-3-27B2025.11 | 69.8 | |
| Hard Neg.Backbone=GPT-OSS-120B2025.11 | 69.5 | |
| LLM-JBackbone=Gemma-3-27B2025.11 | 69.2 | |
| LLM-JBackbone=Gemma-3-27B2025.11 | 69.2 | |
| ReST-MCTSBackbone=GPT-OSS-120B2025.11 | 69.1 | |
| ReST-MCTSBackbone=GPT-OSS-120B2025.11 | 69.1 | |
| ReST-MCTSBackbone=GPT-OSS-20B2025.11 | 68.3 | |
| ReST-MCTSBackbone=GPT-OSS-20B2025.11 | 68.3 | |
| rStar MathBackbone=GPT-OSS-20B2025.11 | 68.2 | |
| LLM-JBackbone=GPT-OSS-20B2025.11 | 68 | |
| rStar MathBackbone=GPT-OSS-120B2025.11 | 68 | |
| LLM-JBackbone=GPT-OSS-20B2025.11 | 68 | |
| ToTBackbone=GPT-OSS-20B2025.11 | 67.6 | |
| ToTBackbone=Gemma-3-27B2025.11 | 67.6 | |
| ToTBackbone=GPT-OSS-20B2025.11 | 67.6 | |
| ToTBackbone=Gemma-3-27B2025.11 | 67.6 | |
| ToTBackbone=GPT-OSS-120B2025.11 | 66.4 | |
| ToTBackbone=GPT-OSS-120B2025.11 | 66.4 | |
| LLM-JBackbone=GPT-OSS-120B2025.11 | 66 | |
| LLM-JBackbone=GPT-OSS-120B2025.11 | 66 | |
| AutoPSVBackbone=GPT-OSS-120B2025.11 | 65 | |
| Math S.Backbone=GPT-OSS-120B2025.11 | 64.5 | |
| Verify SbS.Backbone=GPT-OSS-120B2025.11 | 63.5 | |
| Hard Neg.Backbone=Gemma-3-27B2025.11 | 63 | |
| CoT-SCBackbone=GPT-OSS-120B2025.11 | 62.8 | |
| CoT-SCBackbone=GPT-OSS-120B2025.11 | 62.8 | |
| ARMBackbone=GPT-OSS-120B2025.11 | 62.4 | |
| AutoPSVBackbone=GPT-OSS-20B2025.11 | 60 | |
| AutoPSVBackbone=Gemma-3-27B2025.11 | 60 | |
| Math S.Backbone=GPT-OSS-20B2025.11 | 58 | |
| Math S.Backbone=Gemma-3-27B2025.11 | 58 | |
| Verify SbS.Backbone=GPT-OSS-20B2025.11 | 55 | |
| Verify SbS.Backbone=Gemma-3-27B2025.11 | 55 | |
| APRMBackbone=Gemma-3-12B2025.11 | 53.1 | |
| APRMBackbone=Gemma-3-12B2025.11 | 53.1 | |
| ARMBackbone=Gemma-3-27B2025.11 | 51 | |
| ReST-MCTSBackbone=Gemma-3-12B2025.11 | 50.7 | |
| ReST-MCTSBackbone=Gemma-3-12B2025.11 | 50.7 | |
| rStar MathBackbone=Gemma-3-12B2025.11 | 50 | |
| ToTBackbone=Gemma-3-12B2025.11 | 49.2 | |
| ToTBackbone=Gemma-3-12B2025.11 | 49.2 | |
| CoT-SCBackbone=Gemma-3-27B2025.11 | 48.8 | |
| CoT-SCBackbone=Gemma-3-27B2025.11 | 48.8 | |
| CoT-SCBackbone=GPT-OSS-20B2025.11 | 48.4 | |
| CoT-SCBackbone=GPT-OSS-20B2025.11 | 48.4 | |
| AutoPSVBackbone=Gemma-3-12B2025.11 | 45 | |
| Synthesized-TraceSurrogate=R1, Student Model=Qwen2026.03 | 44.9 | |
| Surrogate-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 44.8 | |
| Math S.Backbone=Gemma-3-12B2025.11 | 44 | |
| CoT-SCBackbone=Gemma-3-12B2025.11 | 43.2 | |
| CoT-SCBackbone=Gemma-3-12B2025.11 | 43.2 | |
| Synthesized-TraceStudent Model=Qwen, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 42.3 | |
| Verify SbS.Backbone=Gemma-3-12B2025.11 | 42 | |
| LLM-JBackbone=Gemma-3-12B2025.11 | 40.4 | |
| LLM-JBackbone=Gemma-3-12B2025.11 | 40.4 | |
| Synthesized-TraceStudent Model=Qwen, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 31.6 | |
| Synthesized-TraceSurrogate=R1-Distill, Student Model=Qwen2026.03 | 29.7 | |
| No finetuningSurrogate=–, Student Model=Qwen2026.03 | 28.3 | |
| Surrogate-TraceStudent Model=Llama, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 28.1 | |
| Synthesized-TraceSurrogate=R1, Student Model=Llama2026.03 | 25.2 | |
| Answer-onlySurrogate=–, Student Model=Qwen2026.03 | 21.6 | |
| Answer-onlyStudent Model=Qwen, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 21.5 | |
| Synthesized-TraceStudent Model=Llama, Surrogate=R1, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 19.9 | |
| Surrogate-TraceStudent Model=Qwen, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 19.7 | |
| Surrogate-Trace(R1-Distill)Surrogate=–, Student Model=Qwen2026.03 | 19.7 | |
| Answer-onlySurrogate=–, Student Model=Llama2026.03 | 17.2 | |
| Synthesized-TraceStudent Model=Llama, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 16.8 | |
| No finetuningSurrogate=–, Student Model=Llama2026.03 | 16.6 | |
| Synthesized-TraceSurrogate=R1-Distill, Student Model=Llama2026.03 | 16.3 | |
| Answer+SummaryStudent Model=Qwen, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 11.7 | |
| Surrogate-TraceStudent Model=Llama, Surrogate=R1-Distill, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 11.3 | |
| Surrogate-Trace(R1-Distill)Surrogate=–, Student Model=Llama2026.03 | 11.3 | |
| Answer-onlyStudent Model=Llama, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 10 | |
| Answer+SummaryStudent Model=Llama, Surrogate=None, Fine-tuning=true, Victim Model=GPT-5 mini2026.03 | 8.1 |