Human-level Standardized Exam Evaluation on AGIEval
51.05ScoreCPT
Evaluation Results
| Method | Links | |
|---|---|---|
| CPTSize=70B, Evaluation Mode=zero-shot2024.09 | 51.05 | |
| Llama-3Size=70B, Evaluation Mode=zero-shot2024.09 | 50.83 | |
| Qwen-3Model Type=Open-weight, Number of Parameters=4B2026.03 | 45.87 | |
| Qwen-3.5Model Type=Open-weight, Number of Parameters=4B2026.03 | 44.89 | |
| Llama-3Size=8B, Evaluation Mode=zero-shot2024.09 | 37.55 | |
| CPTSize=8B, Evaluation Mode=zero-shot2024.09 | 37.44 | |
| Qwen-2.5Model Type=Open-weight, Number of Parameters=3B2026.03 | 37.15 | |
| OLMO-3Model Type=Fully-open, Number of Parameters=7B2026.03 | 33.75 | |
| OLMO-2Model Type=Fully-open, Number of Parameters=7B2026.03 | 31.78 | |
| YulanModel Type=Fully-open, Number of Parameters=2.4B2026.03 | 28.22 | |
| daVinciModel Type=Fully-open, Number of Parameters=3B2026.03 | 26.77 | |
| LLaMa-3.2Model Type=Open-weight, Number of Parameters=3B2026.03 | 22.72 | |
| Nemotron-CC_ASIPre-training Curation Strategy=AI Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 18.3 | |
| Nemotron-CC_ASI+Pre-training Curation Strategy=AI Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 18.21 | |
| Nemotron-CCPre-training Curation Strategy=AI Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 18.15 | |
| DCLMPre-training Curation Strategy=Human Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 17.9 | |
| Ultra-FinewebPre-training Curation Strategy=Human Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 17.72 | |
| Fineweb-EduPre-training Curation Strategy=Human Discovered, Model Parameters=3B, Training Token Budget=500B tokens2026.03 | 16.96 |