Question Answering on GPQA (ACC, LEN, Ratio)
94.44AccuracyGEPA Optimized Final
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GEPA Optimized FinalModel=DeepSeek-V3.22026.03 | 94.44 | — | — | — | — | — | |
| Hand-Crafted SimpleModel=DeepSeek-V3.22026.03 | 91.67 | — | — | — | — | — | |
| Hand-Crafted CoTModel=DeepSeek-V3.22026.03 | 91.67 | — | — | — | — | — | |
| Hand-Crafted SimpleModel=GPT-5.4-mini2026.03 | 91.67 | — | — | — | — | — | |
| Hand-Crafted CoTModel=GPT-5.4-mini2026.03 | 91.67 | — | — | — | — | — | |
| GEPA Optimized FinalModel=GPT-5.4-mini2026.03 | 91.67 | — | — | — | — | — | |
| Hand-Crafted SimpleModel=GLM 52026.03 | 91.67 | — | — | — | — | — | |
| GEPA Optimized FinalModel=GLM 52026.03 | 91.67 | — | — | — | — | — | |
| GEPA Optimized BaselineModel=DeepSeek-V3.22026.03 | 88.89 | — | — | — | — | — | |
| GEPA Optimized BaselineModel=GPT-5.4-mini2026.03 | 88.89 | — | — | — | — | — | |
| GEPA Optimized BaselineModel=GLM 52026.03 | 88.89 | — | — | — | — | — | |
| Hand-Crafted CoTModel=GLM 52026.03 | 86.11 | — | — | — | — | — | |
| Hand-Crafted CoTModel=Claude Sonnet 4.62026.03 | 83.33 | — | — | — | — | — | |
| GEPA Optimized BaselineModel=Claude Sonnet 4.62026.03 | 80.56 | — | — | — | — | — | |
| GEPA Optimized FinalModel=Claude Sonnet 4.62026.03 | 80.56 | — | — | — | — | — | |
| Hand-Crafted SimpleModel=Claude Sonnet 4.62026.03 | 77.78 | — | — | — | — | — | |
| Qwen3-8BBase Model=Qwen3-8B2026.03 | 51.52 | — | — | — | — | — | |
| DiPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 43.53 | 2,769 | 85.7 | — | — | — | |
| TALE-EPBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 41.52 | 3,572.7 | 79.1 | — | — | — | |
| CoDBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 39.96 | 3,060.6 | 83.4 | — | — | — | |
| TraDOBase Model=Qwen3-8B2026.03 | 38.89 | — | — | 12.63 | — | — | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2026.03 | 36.36 | — | — | — | — | — | |
| SFTBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 36.16 | 5,370.8 | 77.7 | — | — | — | |
| DPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 35.94 | 5,349.1 | 75.2 | — | — | — | |
| BaselineBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 35.71 | 5,452.9 | 73.7 | — | — | — | |
| dTRPOBase Model=Qwen2.5-7B2026.03 | 30.3 | — | — | 6.06 | — | — | |
| MemRewardBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 30 | — | — | — | 77.02 | -2.1 | |
| R1-OracleBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=100% GT2026.03 | 30 | — | — | — | 79.12 | 0 | |
| SDARBase Model=Qwen3-8B2026.03 | 28.28 | — | — | 23.24 | — | — | |
| MemRewardBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 23.33 | — | — | — | 68.1 | -2.37 | |
| R1-pBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT2026.03 | 21.67 | — | — | — | 75.67 | -3.45 | |
| R1-pBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT2026.03 | 20 | — | — | — | 62.72 | -7.75 | |
| R1-OracleBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=100% GT2026.03 | 15 | — | — | — | 70.47 | 0 |