Question Answering on CommonsenseQA ConceptNet (20% test)
81.3AccuracySAKE
Evaluation Results
| Method | Links | |
|---|---|---|
| SAKEModel=Qwen2.5 7B-Instruct2025.05 | 81.3 | |
| GRPOModel=Qwen2.5 7B-Instruct2025.05 | 79.7 | |
| SFTModel=Qwen2.5 7B-Instruct2025.05 | 79.3 | |
| Search-R1Model=Qwen2.5 7B-Instruct2025.05 | 78.5 | |
| RAGModel=Qwen2.5 7B-Instruct2025.05 | 77.6 | |
| I/O PromptModel=Qwen2.5 7B-Instruct2025.05 | 76.4 | |
| GIVEModel=GPT-3.5 Turbo2025.05 | 74.7 | |
| SAKEModel=Qwen2.5 3B-Instruct2025.05 | 73.2 | |
| ToGModel=GPT-3.5 Turbo2025.05 | 69.8 | |
| SFTModel=Qwen2.5 3B-Instruct2025.05 | 67.5 | |
| GRPOModel=Qwen2.5 3B-Instruct2025.05 | 66.7 | |
| Search-R1Model=Qwen2.5 3B-Instruct2025.05 | 66.7 | |
| CoTModel=Qwen2.5 3B-Instruct2025.05 | 65 | |
| I/O PromptModel=Qwen2.5 3B-Instruct2025.05 | 64.2 | |
| CoTModel=Qwen2.5 7B-Instruct2025.05 | 63.4 | |
| RAGModel=Qwen2.5 3B-Instruct2025.05 | 52 |