Math Reasoning on BeyondBench Hard
58.86AccuracyEFFGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| EFFGENBackbone=Qwen2.5-32B-Instruct2026.01 | 58.86 | |
| EFFGENBackbone=Qwen2.5-14B-Instruct2026.01 | 46.37 | |
| SmolagentsBackbone=Qwen2.5-32B-Instruct2026.01 | 45.83 | |
| SmolagentsBackbone=Qwen2.5-14B-Instruct2026.01 | 34.29 | |
| AutogenBackbone=Qwen2.5-32B-Instruct2026.01 | 30.67 | |
| LangChainBackbone=Qwen2.5-14B-Instruct2026.01 | 29.58 | |
| EFFGENBackbone=Qwen2.5-7B-Instruct2026.01 | 28.57 | |
| LangChainBackbone=Qwen2.5-32B-Instruct2026.01 | 27.14 | |
| Raw ModelBackbone=Qwen2.5-32B-Instruct2026.01 | 26.53 | |
| AutogenBackbone=Qwen2.5-14B-Instruct2026.01 | 24.29 | |
| SmolagentsBackbone=Qwen2.5-7B-Instruct2026.01 | 24.17 | |
| Raw ModelBackbone=Qwen2.5-14B-Instruct2026.01 | 24.17 | |
| EFFGENBackbone=Qwen2.5-3B-Instruct2026.01 | 21.67 | |
| Raw ModelBackbone=Qwen2.5-7B-Instruct2026.01 | 15.42 | |
| LangChainBackbone=Qwen2.5-7B-Instruct2026.01 | 12.86 | |
| SmolagentsBackbone=Qwen2.5-3B-Instruct2026.01 | 8.57 | |
| EFFGENBackbone=Qwen2.5-1.5B-Instruct2026.01 | 7.92 | |
| Raw ModelBackbone=Qwen2.5-3B-Instruct2026.01 | 7.33 | |
| AutogenBackbone=Qwen2.5-3B-Instruct2026.01 | 7.14 | |
| AutogenBackbone=Qwen2.5-7B-Instruct2026.01 | 7.14 | |
| LangChainBackbone=Qwen2.5-3B-Instruct2026.01 | 5.71 | |
| Raw ModelBackbone=Qwen2.5-1.5B-Instruct2026.01 | 2.86 | |
| AutogenBackbone=Qwen2.5-1.5B-Instruct2026.01 | 1.67 | |
| SmolagentsBackbone=Qwen2.5-1.5B-Instruct2026.01 | 1.43 | |
| LangChainBackbone=Qwen2.5-1.5B-Instruct2026.01 | 1.43 |