Scientific Reasoning on GPQA (Accuracy)
83.8AccuracyNanbeige4.1-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Nanbeige4.1-3BParameters=3B2026.02 | 83.8 | |
| Nanbeige4-3B-2511Parameters=3B2026.02 | 82.2 | |
| Qwen3-Next-80B-A3BParameters=80B2026.02 | 77.2 | |
| Qwen3-30B-A3B-2507Parameters=30B2026.02 | 73.4 | |
| Qwen3-32BParameters=32B2026.02 | 68.4 | |
| Qwen3-4B-2507Parameters=4B2026.02 | 65.8 | |
| Poisoned-RM (Thought-Transfer)Objective=Advertisement Injection2026.01 | 51 | |
| Poisoned-RM (Thought-Transfer)Objective=Concept Manipulation2026.01 | 45.5 | |
| Qwen-14B (Base Model)Objective=Advertisement Injection2026.01 | 39.4 | |
| Qwen-14B (Base Model)Objective=Concept Manipulation2026.01 | 39.4 | |
| Ouro2.6B-Thinking + RLTT2026.02 | 38.4 | |
| BF16Bit=BF16, Model=Qwen3-4B, Group size (g)=N/A2026.02 | 38.38 | |
| GPTQBit=4-bit, Model=Qwen3-8B, Group size (g)=1282026.02 | 36.86 | |
| OJBKQBit=4-bit, Model=Qwen3-4B, Group size (g)=1282026.02 | 36.36 | |
| BF16Bit=BF16, Model=LLaMA3-8B, Group size (g)=N/A2026.02 | 35.98 | |
| OJBKQBit=4-bit, Model=Qwen3-8B, Group size (g)=1282026.02 | 34.34 | |
| AWQBit=4-bit, Model=Qwen3-4B, Group size (g)=1282026.02 | 33.33 | |
| BF16Bit=BF16, Model=Qwen3-8B, Group size (g)=N/A2026.02 | 33.33 | |
| OJBKQBit=4-bit, Model=LLaMA3-8B, Group size (g)=1282026.02 | 32.93 | |
| AWQBit=4-bit, Model=Qwen3-8B, Group size (g)=1282026.02 | 32.83 | |
| AWQBit=4-bit, Model=LLaMA3-8B, Group size (g)=1282026.02 | 32.32 | |
| GPTQBit=4-bit, Model=Qwen3-4B, Group size (g)=1282026.02 | 31.81 | |
| QUIPBit=4-bit, Model=Qwen3-8B, Group size (g)=1282026.02 | 31.31 | |
| EB-SamplerModel=LLaDA-Instruct-8B, Decoding Strategy=EB-Sampler2025.12 | 29.9 | |
| QUIPBit=4-bit, Model=LLaMA3-8B, Group size (g)=1282026.02 | 29.87 | |
| GPTQBit=4-bit, Model=LLaMA3-8B, Group size (g)=1282026.02 | 29.27 | |
| UniformModel=LLaDA-Instruct-8B, Decoding Strategy=Uniform2025.12 | 29 | |
| ConfidenceModel=LLaDA-1.5-8B, Decoding Strategy=Confidence2025.12 | 29 | |
| PC-Sampler w/ E-SMCModel=LLaDA-1.5-8B, Decoding Strategy=PC-Sampler + E-SMC2025.12 | 29 | |
| PC-Sampler w/ E-SMCModel=LLaDA-Instruct-8B, Decoding Strategy=PC-Sampler + E-SMC2025.12 | 28.9 | |
| PC-Sampler w/ E-BONModel=LLaDA-1.5-8B, Decoding Strategy=PC-Sampler + E-BON2025.12 | 28.9 | |
| PC-Sampler w/ E-BONModel=LLaDA-Instruct-8B, Decoding Strategy=PC-Sampler + E-BON2025.12 | 28.8 | |
| EntropyModel=LLaDA-1.5-8B, Decoding Strategy=Entropy2025.12 | 28.8 | |
| P2Model=LLaDA-1.5-8B, Decoding Strategy=P22025.12 | 28.8 | |
| PC-SamplerModel=LLaDA-1.5-8B, Decoding Strategy=PC-Sampler2025.12 | 28.8 | |
| Fast-dLLMModel=LLaDA-Instruct-8B, Decoding Strategy=Fast-dLLM2025.12 | 28.6 | |
| PC-SamplerModel=LLaDA-Instruct-8B, Decoding Strategy=PC-Sampler2025.12 | 28.6 | |
| MarginModel=LLaDA-1.5-8B, Decoding Strategy=Margin2025.12 | 28.6 | |
| EB-SamplerModel=LLaDA-1.5-8B, Decoding Strategy=EB-Sampler2025.12 | 28.6 | |
| EntropyModel=LLaDA-Instruct-8B, Decoding Strategy=Entropy2025.12 | 28.4 | |
| MarginModel=LLaDA-Instruct-8B, Decoding Strategy=Margin2025.12 | 28.4 | |
| P2Model=LLaDA-Instruct-8B, Decoding Strategy=P22025.12 | 28.2 | |
| UniformModel=LLaDA-1.5-8B, Decoding Strategy=Uniform2025.12 | 28.1 | |
| ConfidenceModel=LLaDA-Instruct-8B, Decoding Strategy=Confidence2025.12 | 27.9 | |
| Fast-dLLMModel=LLaDA-1.5-8B, Decoding Strategy=Fast-dLLM2025.12 | 27.9 | |
| Semi-ARModel=LLaDA-Instruct-8B, Decoding Strategy=Semi-AR2025.12 | 27.7 | |
| Semi-ARModel=LLaDA-1.5-8B, Decoding Strategy=Semi-AR2025.12 | 26.1 | |
| QUIPBit=4-bit, Model=Qwen3-4B, Group size (g)=1282026.02 | 25.75 | |
| Ouro2.6B-Thinking + GRPO2026.02 | 19.7 | |
| Ouro2.6B-Thinking2026.02 | 18.7 | |
| Ouro2.6B-Thinking + SFT2026.02 | 17.7 | |
| Qwen3 – 4B2026.02 | 11.1 | |
| DeepSeekR1 – 7B2026.02 | 11.1 | |
| DeepSeekR1 – 1.5B2026.02 | 6.57 | |
| Qwen3 – 1.7B2026.02 | 4.55 |