Retrieval on ARC Challenge
93.34AccuracyLangChain
Evaluation Results
| Method | Links | |
|---|---|---|
| LangChainModel=Qwen2.5-32B-Instruct2026.01 | 93.34 | |
| SmolagentsModel=Qwen2.5-32B-Instruct2026.01 | 93.26 | |
| Raw ModelModel=Qwen2.5-32B-Instruct2026.01 | 92.92 | |
| EFFGENModel=Qwen2.5-32B-Instruct2026.01 | 92.5 | |
| LangChainModel=Qwen2.5-14B-Instruct2026.01 | 91.13 | |
| SmolagentsModel=Qwen2.5-14B-Instruct2026.01 | 90.87 | |
| EFFGENModel=Qwen2.5-14B-Instruct2026.01 | 89.86 | |
| AutogenModel=Qwen2.5-14B-Instruct2026.01 | 89.42 | |
| AutogenModel=Qwen2.5-32B-Instruct2026.01 | 89.25 | |
| Raw ModelModel=Qwen2.5-14B-Instruct2026.01 | 88.99 | |
| EFFGENModel=Qwen2.5-7B-Instruct2026.01 | 87.88 | |
| LangChainModel=Qwen2.5-7B-Instruct2026.01 | 86.95 | |
| EFFGENModel=Qwen2.5-3B-Instruct2026.01 | 86.1 | |
| Raw ModelModel=Qwen2.5-7B-Instruct2026.01 | 83.79 | |
| Raw ModelModel=Qwen2.5-3B-Instruct2026.01 | 79.28 | |
| EFFGENModel=Qwen2.5-1.5B-Instruct2026.01 | 78.34 | |
| AutogenModel=Qwen2.5-7B-Instruct2026.01 | 76.28 | |
| LangChainModel=Qwen2.5-3B-Instruct2026.01 | 74.49 | |
| AutogenModel=Qwen2.5-3B-Instruct2026.01 | 73.04 | |
| SmolagentsModel=Qwen2.5-7B-Instruct2026.01 | 71.25 | |
| Raw ModelModel=Qwen2.5-1.5B-Instruct2026.01 | 67.24 | |
| LangChainModel=Qwen2.5-1.5B-Instruct2026.01 | 59.13 | |
| SmolagentsModel=Qwen2.5-1.5B-Instruct2026.01 | 53.85 | |
| AutogenModel=Qwen2.5-1.5B-Instruct2026.01 | 53.75 | |
| SmolagentsModel=Qwen2.5-3B-Instruct2026.01 | 36.69 |