Reasoning on CQA
98.86AccuracyCOSE
Evaluation Results
| Method | Links | |
|---|---|---|
| COSEModel=Qwen3-0.6B2026.05 | 98.86 | |
| COSEModel=Qwen3-4B2026.05 | 98.68 | |
| COSEModel=Llama-3.2-3B-Instruct2026.05 | 98.35 | |
| MAEModel=Llama-3.2-3B-Instruct2026.05 | 98 | |
| MAEModel=Qwen3-4B2026.05 | 97.6 | |
| AZRModel=Qwen3-4B2026.05 | 97.4 | |
| R-ZeroModel=Qwen3-4B2026.05 | 97.3 | |
| BaseModel=Qwen3-4B2026.05 | 97 | |
| COSEModel=Qwen2.5-3B-Instruct2026.05 | 78.33 | |
| AZRModel=Qwen2.5-3B-Instruct2026.05 | 74.36 | |
| R-ZeroModel=Qwen2.5-3B-Instruct2026.05 | 72.4 | |
| MAEModel=Qwen2.5-3B-Instruct2026.05 | 71.54 | |
| R-ZeroModel=Llama-3.2-3B-Instruct2026.05 | 70.27 | |
| AZRModel=Llama-3.2-3B-Instruct2026.05 | 68.73 | |
| TAIATraining Dataset=CoT-Collection, Infer Mode=TAIA2024.05 | 67.32 | |
| BaseModel=Qwen2.5-3B-Instruct2026.05 | 66.8 | |
| TAIATraining Dataset=Alpaca-GPT4, Infer Mode=TAIA2024.05 | 64.29 | |
| BaseModel=Llama-3.2-3B-Instruct2026.05 | 64 | |
| MAEModel=Qwen3-0.6B2026.05 | 61.2 | |
| EWCTraining Dataset=Alpaca-GPT4, Infer Mode=EWC2024.05 | 60.52 | |
| VanillaTraining Dataset=Alpaca-GPT4, Infer Mode=Vanilla2024.05 | 60.44 | |
| R-ZeroModel=Qwen3-0.6B2026.05 | 60.1 | |
| LoRACLTraining Dataset=Alpaca-GPT4, Infer Mode=LORACL2024.05 | 60.03 | |
| VanillaTraining Dataset=Base Model, Infer Mode=Vanilla2024.05 | 58.39 | |
| VanillaTraining Dataset=CoT-Collection, Infer Mode=Vanilla2024.05 | 58.07 | |
| LoRACLTraining Dataset=CoT-Collection, Infer Mode=LORACL2024.05 | 58.07 | |
| L2Training Dataset=Alpaca-GPT4, Infer Mode=L22024.05 | 57.82 | |
| AZRModel=Qwen3-0.6B2026.05 | 57.63 | |
| BaseModel=Qwen3-0.6B2026.05 | 55 | |
| Self-DistillTraining Dataset=Alpaca-GPT4, Infer Mode=Self-Distill2024.05 | 53.07 | |
| L2Training Dataset=CoT-Collection, Infer Mode=L22024.05 | 23.26 | |
| EWCTraining Dataset=CoT-Collection, Infer Mode=EWC2024.05 | 22.64 |