Retrieval on CommonsenseQA
86.81AccuracyRaw Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Raw ModelModel=Qwen2.5-32B-Instruct2026.01 | 86.81 | |
| EFFGENModel=Qwen2.5-32B-Instruct2026.01 | 86.8 | |
| EFFGENModel=Qwen2.5-14B-Instruct2026.01 | 86 | |
| EFFGENModel=Qwen2.5-3B-Instruct2026.01 | 85.02 | |
| SmolagentsModel=Qwen2.5-32B-Instruct2026.01 | 84.93 | |
| LangChainModel=Qwen2.5-32B-Instruct2026.01 | 84.28 | |
| Raw ModelModel=Qwen2.5-14B-Instruct2026.01 | 83.37 | |
| EFFGENModel=Qwen2.5-7B-Instruct2026.01 | 83.05 | |
| Raw ModelModel=Qwen2.5-7B-Instruct2026.01 | 82.8 | |
| SmolagentsModel=Qwen2.5-14B-Instruct2026.01 | 82.8 | |
| AutogenModel=Qwen2.5-32B-Instruct2026.01 | 81.65 | |
| LangChainModel=Qwen2.5-14B-Instruct2026.01 | 81.49 | |
| AutogenModel=Qwen2.5-14B-Instruct2026.01 | 79.69 | |
| LangChainModel=Qwen2.5-7B-Instruct2026.01 | 79.12 | |
| SmolagentsModel=Qwen2.5-7B-Instruct2026.01 | 76.33 | |
| Raw ModelModel=Qwen2.5-3B-Instruct2026.01 | 75.02 | |
| EFFGENModel=Qwen2.5-1.5B-Instruct2026.01 | 74.62 | |
| Raw ModelModel=Qwen2.5-1.5B-Instruct2026.01 | 72.73 | |
| AutogenModel=Qwen2.5-3B-Instruct2026.01 | 72.65 | |
| LangChainModel=Qwen2.5-3B-Instruct2026.01 | 70.84 | |
| AutogenModel=Qwen2.5-7B-Instruct2026.01 | 58.64 | |
| AutogenModel=Qwen2.5-1.5B-Instruct2026.01 | 57.82 | |
| LangChainModel=Qwen2.5-1.5B-Instruct2026.01 | 54.3 | |
| SmolagentsModel=Qwen2.5-3B-Instruct2026.01 | 41.03 | |
| SmolagentsModel=Qwen2.5-1.5B-Instruct2026.01 | 32.41 |