Reasoning on SuperGPQA (Pass@1, Pass@4)
38.4Pass@1CER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CERBackbone=Qwen3-8B-Base, Reward Method=CER, Training Data Domain=General-domain2026.03 | 38.4 | — | |
| Rule+CERBackbone=Qwen3-8B-Base, Reward Method=Rule+CER, Training Data Domain=General-domain2026.03 | 38.3 | — | |
| Rule-basedBackbone=Qwen3-8B-Base, Reward Method=Rule-based, Training Data Domain=General-domain2026.03 | 37.7 | — | |
| General-verifierBackbone=Qwen3-8B-Base, Reward Method=General-verifier, Training Data Domain=General-domain2026.03 | 37.7 | — | |
| Exact-MatchBackbone=Qwen3-8B-Base, Reward Method=Exact-Match, Training Data Domain=General-domain2026.03 | 36.2 | — | |
| VeriFreeBackbone=Qwen3-8B-Base, Reward Method=VeriFree, Training Data Domain=General-domain2026.03 | 35.5 | — | |
| CERBackbone=Qwen3-4B-Base, Reward Method=CER, Training Data Domain=General-domain2026.03 | 35.2 | — | |
| Rule+CERBackbone=Qwen3-4B-Base, Reward Method=Rule+CER, Training Data Domain=General-domain2026.03 | 35.2 | — | |
| General-verifierBackbone=Qwen3-4B-Base, Reward Method=General-verifier, Training Data Domain=General-domain2026.03 | 34.2 | — | |
| Exact-MatchBackbone=Qwen3-4B-Base, Reward Method=Exact-Match, Training Data Domain=General-domain2026.03 | 33.5 | — | |
| Rule-basedBackbone=Qwen3-4B-Base, Reward Method=Rule-based, Training Data Domain=General-domain2026.03 | 32.6 | — | |
| EVOL-RLBase Model=Qwen3-8B-Base, Training=Label-free training on MATH-TRAIN2025.09 | 30.2 | 57 | |
| TTRLBase Model=Qwen3-8B-Base, Training=Label-free training on MATH-TRAIN2025.09 | 29.7 | 53.3 | |
| VeriFreeBackbone=Qwen3-4B-Base, Reward Method=VeriFree, Training Data Domain=General-domain2026.03 | 29.1 | — | |
| BaseBackbone=Qwen3-8B-Base, Reward Method=None, Training Data Domain=General-domain2026.03 | 27 | — | |
| Qwen3-8B-BaseTraining=None (Base Model)2025.09 | 26.5 | 54.1 | |
| BaseBackbone=Qwen3-4B-Base, Reward Method=None, Training Data Domain=General-domain2026.03 | 21 | — |