Scientific Reasoning on JEEBench
57.34Mean AccuracyReason, Reward, Refine
Evaluation Results
| Method | Links | |
|---|---|---|
| Reason, Reward, RefineBackbone=LLaMA 3.2 3B2026.07 | 57.34 | |
| Reason, Reward, RefineBackbone=Qwen 2.5 1.5B2026.07 | 54.86 | |
| Qwen2.5 32B + RL (synthetic)Model Size=32B, Post-training=RL (synthetic)2026.04 | 52.28 | |
| Reason, Reward, RefineBackbone=Phi 3.5 Mini 3.8B2026.07 | 50.23 | |
| Reason, Reward, RefineBackbone=LLaMA 3.2 1B2026.07 | 49.17 | |
| DPOBackbone=Phi 3.5 Mini 3.8B2026.07 | 41.65 | |
| RAGBackbone=Phi 3.5 Mini 3.8B2026.07 | 41.25 | |
| RAGBackbone=LLaMA 3.2 3B2026.07 | 40.83 | |
| RAGBackbone=Qwen 2.5 1.5B2026.07 | 40 | |
| FTBackbone=Qwen 2.5 1.5B2026.07 | 39.02 | |
| DPOBackbone=LLaMA 3.2 3B2026.07 | 38.21 | |
| FTBackbone=Phi 3.5 Mini 3.8B2026.07 | 38.04 | |
| CoTBackbone=Qwen 2.5 1.5B2026.07 | 37.53 | |
| FTBackbone=LLaMA 3.2 3B2026.07 | 36.59 | |
| CoTBackbone=Phi 3.5 Mini 3.8B2026.07 | 35.9 | |
| DPOBackbone=LLaMA 3.2 1B2026.07 | 35.77 | |
| RAGBackbone=LLaMA 3.2 1B2026.07 | 35.5 | |
| Qwen2.5 32BModel Size=32B, Variant=Instruct2026.04 | 34.38 | |
| CoTBackbone=LLaMA 3.2 1B2026.07 | 32.52 | |
| CoTBackbone=LLaMA 3.2 3B2026.07 | 30.21 | |
| DPOBackbone=Qwen 2.5 1.5B2026.07 | 30.08 | |
| FTBackbone=LLaMA 3.2 1B2026.07 | 28.46 |