General Reasoning on GPQA
86.4AccuracyGemini 2.5 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 2.5 ProInput Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 86.4 | |
| GPT-5 highInput Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 85.7 | |
| BaseModel=Qwen3-4B2026.05 | 85 | |
| COSEModel=Qwen3-4B2026.05 | 84.85 | |
| Claude Sonnet 4.5Input Modality=Text, LLM-as-a-Judge=GPT-4o2025.11 | 83.4 | |
| AZRModel=Qwen3-4B2026.05 | 83.2 | |
| COSEModel=Llama-3.2-3B-Instruct2026.05 | 83.02 | |
| COSEModel=Qwen3-0.6B2026.05 | 82.67 | |
| MAEModel=Qwen3-4B2026.05 | 82.6 | |
| R-ZeroModel=Qwen3-4B2026.05 | 82.4 | |
| MAEModel=Llama-3.2-3B-Instruct2026.05 | 81 | |
| Sora-2 AudioInput Modality=Audio, LLM-as-a-Judge=GPT-4o2025.11 | 57.6 | |
| Sora-2 Last FrameInput Modality=Last Frame, LLM-as-a-Judge=GPT-4o2025.11 | 51.5 | |
| GSPOBackbone=Qwen3-4B-Base2026.02 | 48.5 | |
| GSPO + LIEBackbone=Qwen3-4B-Base, Strategy=Length-Incentivized Exploration2026.02 | 47.5 | |
| GRPO + LIEBackbone=Qwen3-4B-Base, Strategy=Length-Incentivized Exploration2026.02 | 46.5 | |
| GRPO w/Clip-higherBackbone=Qwen3-4B-Base, Variant=Clip-higher2026.02 | 46 | |
| GRPOBackbone=Qwen3-4B-Base2026.02 | 44.4 | |
| GRPO w/Clip-higher + LIEBackbone=Qwen3-4B-Base, Variant=Clip-higher, Strategy=Length-Incentivized Exploration2026.02 | 43.9 | |
| R-ZeroModel=Llama-3.2-3B-Instruct2026.05 | 42.6 | |
| AZRModel=Llama-3.2-3B-Instruct2026.05 | 39.73 | |
| AZRModel=Qwen2.5-3B-Instruct2026.05 | 38.93 | |
| DiSCTTModel=Qwen-3-4B-Base2026.03 | 38.4 | |
| STRATAGEMModel=STRATAGEM (Ours)2026.04 | 38.23 | |
| BaseModel=Llama-3.2-3B-Instruct2026.05 | 38 | |
| SPIRALModel=SPIRAL2026.04 | 36.41 | |
| R-ZeroModel=Qwen2.5-3B-Instruct2026.05 | 35.6 | |
| MAEModel=Qwen2.5-3B-Instruct2026.05 | 35.42 | |
| MAEModel=Qwen3-0.6B2026.05 | 35.1 | |
| DiSCTTModel=Qwen-2.5-7B-Instruct2026.03 | 34.9 | |
| R-ZeroModel=Qwen3-0.6B2026.05 | 34.8 | |
| BaseModel=Qwen2.5-3B-Instruct2026.05 | 34.67 | |
| COSEModel=Qwen2.5-3B-Instruct2026.05 | 34.67 | |
| AZRModel=Qwen3-0.6B2026.05 | 32.23 | |
| Qwen3-4B-BaseModel=Qwen3-4B-Base2026.04 | 30.6 | |
| EVOL-RLModel=Qwen-3-4B-Base2026.03 | 30.3 | |
| BaseModel=Qwen3-0.6B2026.05 | 30 | |
| DiSCTTModel=Qwen-3-1.7B-Base2026.03 | 29.3 | |
| EVOL-RLModel=Qwen-2.5-7B-Instruct2026.03 | 29.3 | |
| EVOL-RLModel=Qwen-3-1.7B-Base2026.03 | 28.8 | |
| TTRLModel=Qwen-3-4B-Base2026.03 | 28.8 | |
| TTRLModel=Qwen-2.5-7B-Instruct2026.03 | 28.8 | |
| BaseModel=Qwen-3-4B-Base2026.03 | 27.3 | |
| BaseModel=Qwen-2.5-7B-Instruct2026.03 | 27.3 | |
| Qwen3-4B-Base2026.02 | 26.3 | |
| TTRLModel=Qwen-3-1.7B-Base2026.03 | 25.8 | |
| DiSCTTModel=LLaMA-3.2-3B-Instruct2026.03 | 24.3 | |
| DiSCTTModel=Qwen-2.5-0.5B-Instruct2026.03 | 24.2 | |
| DiSCTTModel=LLaMA-3.2-1B-Instruct2026.03 | 23.8 | |
| BaseModel=Qwen-3-1.7B-Base2026.03 | 23.2 | |
| EVOL-RLModel=LLaMA-3.2-3B-Instruct2026.03 | 20.7 | |
| EVOL-RLModel=Qwen-2.5-0.5B-Instruct2026.03 | 18.2 | |
| TTRLModel=Qwen-2.5-0.5B-Instruct2026.03 | 16.2 | |
| TTRLModel=LLaMA-3.2-3B-Instruct2026.03 | 16.2 | |
| BaseModel=Qwen-2.5-0.5B-Instruct2026.03 | 14.1 | |
| EVOL-RLModel=LLaMA-3.2-1B-Instruct2026.03 | 14.1 | |
| BaseModel=LLaMA-3.2-3B-Instruct2026.03 | 13.6 | |
| TTRLModel=LLaMA-3.2-1B-Instruct2026.03 | 10.6 | |
| BaseModel=LLaMA-3.2-1B-Instruct2026.03 | 7.1 |