Knowledge on GPQA (Score, TPF)
69.16ScoreLing-flash-2.0
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ling-flash-2.02026.02 | 69.16 | 100 | |
| LLaDA2.1-flashInference Mode=Q Mode2026.02 | 67.3 | 237 | |
| LLaDA2.1-flashInference Mode=S Mode2026.02 | 66.67 | 395 | |
| LLaDA2.0-flash2026.02 | 62.31 | 329 | |
| Ling-mini-2.02026.02 | 59.41 | — | |
| Qwen3-30B-A3B-Inst-25072026.02 | 54.14 | 100 | |
| LLaDA2.1-minimode=Q Mode2026.02 | 53.28 | 2.12 | |
| LLaDA2.1-minimode=S Mode2026.02 | 48.36 | 3.62 | |
| Qwen3-8Bno think=true2026.02 | 48.01 | — | |
| LLaDA2.0-mini2026.02 | 47.76 | 2.73 | |
| LFM2-1.2B# Total Params=1.2B, # Trained Tokens=11T2025.11 | 31.47 | — | |
| UM-190kshots=0-shot2025.11 | 30.43 | — | |
| UM-187kshots=0-shot2025.11 | 29.85 | — | |
| Llama-3.2-1B# Total Params=1.2B, # Trained Tokens=9T2025.11 | 28.84 | — | |
| UM-190kBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 28.77 | — | |
| HelpSteershots=0-shot2025.11 | 28.61 | — | |
| LFM2-700M# Total Params=0.70B, # Trained Tokens=11T2025.11 | 28.48 | — | |
| UM-187kBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 28.35 | — | |
| TuluDPOshots=0-shot2025.11 | 28.27 | — | |
| UltraFBshots=0-shot2025.11 | 28.1 | — | |
| ORPOshots=0-shot2025.11 | 27.94 | — | |
| UM-170kshots=0-shot2025.11 | 27.92 | — | |
| Qwen3-1.7B# Total Params=1.7B, # Trained Tokens=36T2025.11 | 27.72 | — | |
| SFTshots=0-shot2025.11 | 27.6 | — | |
| ORPOBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 27.52 | — | |
| LFM2-350M# Total Params=0.35B, # Trained Tokens=11T2025.11 | 27.46 | — | |
| TuluDPOBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 27.43 | — | |
| UltraFBBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 27.43 | — | |
| HelpSteerBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 27.35 | — | |
| UM-170kBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 27.35 | — | |
| CodePrefBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 26.85 | — | |
| SFTBackbone=Apertus-8B-SFT, Evaluation Protocol=0-shot2025.11 | 25.67 | — | |
| CodePrefshots=0-shot2025.11 | 25.59 | — | |
| Qwen3-0.6B# Total Params=0.6B, # Trained Tokens=36T2025.11 | 22.14 | — | |
| Gemma-3-1B# Total Params=1B, # Trained Tokens=2T2025.11 | 21.07 | — |