Reasoning on Reasoning Benchmark Suite Aggregate
59.44Average Scoregpt-oss-puzzle-88B
Evaluation Results
| Method | Links | |
|---|---|---|
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=BF162026.02 | 59.44 | |
| gpt-oss-120BReasoning effort=High, KV cache precision=BF162026.02 | 59.2 | |
| gpt-oss-puzzle-88BReasoning effort=High, KV cache precision=FP82026.02 | 58.67 | |
| gpt-oss-120BReasoning effort=High, KV cache precision=FP82026.02 | 58.19 | |
| NEMOTRON-CROSSTHINKCategory=Data Source, Blend=Bgpr↑2025.04 | 58.12 | |
| NEMOTRON-CROSSTHINKCategory=Single Source, Blend=Bonly_mr2025.04 | 57.82 | |
| NEMOTRON-CROSSTHINKCategory=Data Source, Blend=Bmr↑2025.04 | 57.72 | |
| NEMOTRON-CROSSTHINKCategory=Question Types, Blend=Bopen↑2025.04 | 57.49 | |
| NEMOTRON-CROSSTHINKCategory=Data Usefulness, Blend=Bscore2025.04 | 56.95 | |
| NEMOTRON-CROSSTHINKCategory=Question Types, Blend=Bmcq↑2025.04 | 56.89 | |
| R-Few (5%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 56.7 | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=BF162026.02 | 56.64 | |
| General-ReasonerBackbone=Qwen3-8B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 56 | |
| NEMOTRON-CROSSTHINKBlend=Bnd2025.04 | 55.66 | |
| SPICEBackbone=Qwen3-8B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 55.4 | |
| ORZModel=ORZ2025.04 | 55.2 | |
| R-Few (1%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 55.1 | |
| gpt-oss-puzzle-88BReasoning effort=Medium, KV cache precision=FP82026.02 | 54.93 | |
| General-ReasonerBackbone=Qwen3-4B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 54.3 | |
| R-ZeroBackbone=Qwen3-8B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 53.7 | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=BF162026.02 | 53.66 | |
| NEMOTRON-CROSSTHINKCategory=Single Source, Blend=Bonly_gpr2025.04 | 53.3 | |
| gpt-oss-120BReasoning effort=Medium, KV cache precision=FP82026.02 | 52.89 | |
| Absolute ZeroBackbone=Qwen3-8B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 52.8 | |
| SPICEBackbone=Qwen3-4B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 51.4 | |
| R-Few (5%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 50.7 | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=BF162026.02 | 50.61 | |
| R-Few (1%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 49.9 | |
| Base ModelBackbone=Qwen3-8B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 49.9 | |
| gpt-oss-puzzle-88BReasoning effort=Low, KV cache precision=FP82026.02 | 48.38 | |
| R-ZeroBackbone=Qwen3-4B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 48.2 | |
| Absolute ZeroBackbone=Qwen3-4B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 46.9 | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=BF162026.02 | 45.41 | |
| MModel=M2025.04 | 44.75 | |
| gpt-oss-120BReasoning effort=Low, KV cache precision=FP82026.02 | 44.71 | |
| Base ModelBackbone=Qwen3-4B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 41.9 |