Multiple Choice Question Answering on SuperGPQA MCQA
63.83AccuracyPrincipia-4B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Principia-4BTraining Data=Principia Collec.2026.03 | 63.83 | — | |
| Polaris-4BTraining Data=Polaris-Data.2026.03 | 62.18 | — | |
| Qwen3-4B (thinking)Training Data=-2026.03 | 58.87 | — | |
| Principia-4B-ZeroTraining Data=Principia Collec.2026.03 | 45.53 | — | |
| DeepScaleRBase Model=Qwen3-4B-Base, Status=Reimplemented, Training Data=DeepScaleR2026.03 | 43.38 | — | |
| Qwen3-4B (no-thinking)Training Data=-2026.03 | 39.78 | — | |
| General-Reasoner-4BTraining Data=WebInstruct-Ver.2026.03 | 39.63 | — | |
| Principia-7B-ZeroTraining Data=Principia Collec.2026.03 | 38.8 | — | |
| OpenReasoner-ZeroTraining Data=ORZ-Math-Coll.2026.03 | 37.1 | — | |
| DeepScaleRBase Model=OctoThinker-8B-Long-Base, Status=Reimplemented, Training Data=DeepScaleR2026.03 | 34.36 | — | |
| WebInstruct-Ver.Base Model=OctoThinker-8B-Long-Base, Status=Reimplemented, Training Data=WebInstruct-Ver.2026.03 | 34.31 | — | |
| Princpia-8B-ZeroTraining Data=Principia Collec.2026.03 | 33.49 | — | |
| General-Reasoner-7BTraining Data=WebInstruct-Ver.2026.03 | 32.95 | — | |
| Qwen2.5-7B-InstructTraining Data=-2026.03 | 32.61 | — | |
| K-stage RKSolver choice=Runge–Kutta, K=22026.05 | 31.7 | — | |
| Heun K=1Solver choice=Heun, K=12026.05 | 31.05 | — | |
| Baseline2026.05 | 31 | — | |
| SimpleRL-7B-ZooTraining Data=SimpleZoo-Data.2026.03 | 28.49 | — | |
| Qwen3-4B-BaseTraining Data=-2026.03 | 20.46 | — | |
| Qwen2.5-7B-BaseTraining Data=-2026.03 | 20.41 | — | |
| OctoThinker-8B-Long-BaseTraining Data=-2026.03 | 6.53 | — |