General Reasoning on SQuAD (Accuracy)
95.33AccuracyCOSE
Evaluation Results
| Method | Links | |
|---|---|---|
| COSEModel=Qwen3-0.6B2026.05 | 95.33 | |
| COSEModel=Qwen3-4B2026.05 | 95.15 | |
| COSEModel=Qwen2.5-3B-Instruct2026.05 | 95.01 | |
| COSEModel=Llama-3.2-3B-Instruct2026.05 | 94.52 | |
| AZRModel=Qwen3-4B2026.05 | 94.2 | |
| MAEModel=Qwen3-4B2026.05 | 94 | |
| R-ZeroModel=Qwen3-4B2026.05 | 93.8 | |
| MAEModel=Qwen2.5-3B-Instruct2026.05 | 92.28 | |
| MAEModel=Llama-3.2-3B-Instruct2026.05 | 92 | |
| R-ZeroModel=Qwen2.5-3B-Instruct2026.05 | 91.4 | |
| BaseModel=Qwen3-4B2026.05 | 91 | |
| AZRModel=Qwen2.5-3B-Instruct2026.05 | 90.85 | |
| MAEModel=Qwen3-0.6B2026.05 | 89.6 | |
| AZRModel=Qwen3-0.6B2026.05 | 89.21 | |
| R-ZeroModel=Qwen3-0.6B2026.05 | 88.9 | |
| BaseModel=Qwen3-0.6B2026.05 | 85 | |
| AZRModel=Llama-3.2-3B-Instruct2026.05 | 83.46 | |
| BaseModel=Qwen2.5-3B-Instruct2026.05 | 78.2 | |
| R-ZeroModel=Llama-3.2-3B-Instruct2026.05 | 78.18 | |
| BaseModel=Llama-3.2-3B-Instruct2026.05 | 72 |