Diagnostic Reasoning on ER-Reason
72.14Final AccuracySEA (Qwen-8b)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SEA (Qwen-8b)Backbone Model=Qwen-8b2026.04 | 72.14 | 20 | 35 | |
| GPT-5.2 (Zeroshot + Dual Memory)Evaluation Protocol=Memory-Augmented, Backbone Model=GPT-5.2, Setup=Zeroshot + Dual Memory2026.04 | 69.44 | 15 | 17 | |
| SEA (Qwen-4b)Backbone Model=Qwen-4b2026.04 | 68.5 | 23 | 32 | |
| Qwen-8b (RL-DiagnosticRewardOnly)Evaluation Protocol=Trained Baselines, Backbone Model=Qwen-8b, Training=RL-DiagnosticRewardOnly2026.04 | 59.06 | 1 | 3 | |
| Qwen-8b (SFT)Evaluation Protocol=Trained Baselines, Backbone Model=Qwen-8b, Training=SFT2026.04 | 56.82 | -2 | 1 | |
| Qwen-8b (SFT + Dual Memory)Evaluation Protocol=Memory-Augmented, Backbone Model=Qwen-8b, Setup=SFT + Dual Memory2026.04 | 54.21 | 19 | 21 | |
| GPT-5.2Evaluation Protocol=Zeroshot, Backbone Model=GPT-5.22026.04 | 53.16 | 8 | 13 | |
| Qwen-8bEvaluation Protocol=Zeroshot, Backbone Model=Qwen-8b2026.04 | 44.61 | 1 | 6 | |
| Qwen-4bEvaluation Protocol=Zeroshot, Backbone Model=Qwen-4b2026.04 | 41.88 | -5 | 8 |