Sentence Classification on Combined dataset (K1, K2, K3, R4)
76.9PrecisionQwen3.5 9B Multi-agent
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3.5 9B Multi-agentModel=Qwen3.5 9B, Prompting=Multi-Agent2026.05 | 76.9 | 40 | 52.6 | 44.2 | 0.446 | |
| BERT (10-fold CV)Model Type=BERT, Evaluation Protocol=10-fold cross-validation2026.05 | 73 | 71 | 72 | 71.4 | 0.59 | |
| Qwen3.5 9B Zero-Shot (baseline)Model=Qwen3.5 9B, Prompting=Zero-Shot2026.05 | 70.8 | 45.8 | 55.6 | 49.3 | 0.444 | |
| SVM (10-fold CV)Model Type=SVM, Evaluation Protocol=10-fold cross-validation2026.05 | 68 | 59 | 63.2 | 60.6 | 0.48 | |
| Gemini 2.5 Flash Few-Shot (Error-based)Model=Gemini 2.5 Flash, Prompting=Error-based Few-shot, k-examples=52026.05 | 65.2 | 63.7 | 64.4 | 64 | 0.504 | |
| Qwen3.5 9B Few-Shot (Error-based)Model=Qwen3.5 9B, Prompting=Error-based Few-shot, k-examples=52026.05 | 64.6 | 61.5 | 63 | 62.1 | 0.486 | |
| LR (10-fold CV)Model Type=Logistic Regression, Evaluation Protocol=10-fold cross-validation2026.05 | 62 | 72 | 66.6 | 69.7 | 0.49 | |
| Gemini 2.5 Flash Few-ShotModel=Gemini 2.5 Flash, Prompting=Few-Shot, k-examples=52026.05 | 58.1 | 65.4 | 61.5 | 63.8 | 0.449 | |
| Qwen3.5 9B Few-ShotModel=Qwen3.5 9B, Prompting=Few-Shot, k-examples=52026.05 | 58 | 60.3 | 59.1 | 59.9 | 0.423 | |
| Gemini 2.5 Flash Multi-agentModel=Gemini 2.5 Flash, Prompting=Multi-Agent2026.05 | 56.4 | 78.7 | 65.7 | 72.9 | 0.501 | |
| Qwen3.5 9B CoT + Few-Shot (Error-based) + Multi-agentModel=Qwen3.5 9B, Prompting=CoT + Error-Based Few-Shot + Multi-Agent, k-examples=52026.05 | 56.1 | 45.6 | 50.3 | 47.4 | 0.334 | |
| Gemini 2.5 Flash CoT + Few-Shot (Error-based)Model=Gemini 2.5 Flash, Prompting=CoT + Error-Based Few-Shot, k-examples=52026.05 | 55.8 | 76 | 64.3 | 70.9 | 0.48 | |
| Gemini 2.5 Flash Zero-Shot (baseline)Model=Gemini 2.5 Flash, Prompting=Zero-Shot2026.05 | 55.4 | 80.8 | 65.8 | 74 | 0.502 | |
| Gemini 2.5 Flash CoT + Few-Shot (Error-based) + Multi-agentModel=Gemini 2.5 Flash, Prompting=CoT + Error-Based Few-Shot + Multi-Agent, k-examples=52026.05 | 55.3 | 73.4 | 63.1 | 68.9 | 0.462 | |
| Qwen3.5 9B CoTModel=Qwen3.5 9B, Prompting=Chain-of-Thought (CoT)2026.05 | 54.2 | 74.6 | 62.8 | 69.4 | 0.455 | |
| Qwen3.5 9B CoT + Few-Shot (Error-based)Model=Qwen3.5 9B, Prompting=CoT + Error-Based Few-Shot, k-examples=52026.05 | 54.2 | 80 | 64.6 | 73.1 | 0.484 | |
| Gemini 2.5 Flash CoT + Multi-agentModel=Gemini 2.5 Flash, Prompting=CoT + Multi-Agent2026.05 | 54 | 73.8 | 62.3 | 68.8 | 0.449 | |
| Qwen3.5 9B CoT + Multi-agentModel=Qwen3.5 9B, Prompting=CoT + Multi-Agent2026.05 | 53.9 | 47.7 | 50.6 | 48.8 | 0.326 | |
| Gemini 2.5 Flash CoTModel=Gemini 2.5 Flash, Prompting=Chain-of-Thought (CoT)2026.05 | 50.7 | 77.8 | 61.4 | 70.3 | 0.432 |