Medical Reasoning Segmentation on MR-MedSeg hard case (test)
50.3DiceMediRound + JCM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MediRound + JCMIndependent Model (T)=true2025.11 | 50.3 | 40.5 | 53.4 | |
| MediRoundIndependent Model (T)=true2025.11 | 48.1 | 38.2 | 50.2 | |
| MediRound + READIndependent Model (T)=true2025.11 | 47.2 | 36.8 | 49.1 | |
| Human-Thinking + MediSeeIndependent Model (T)=false2025.11 | 45.1 | 37.1 | 39.7 | |
| Gemini-2.5-Pro + MediSeeIndependent Model (T)=false2025.11 | 38.6 | 28.6 | 30.8 | |
| Qwen3-VL + MediSeeIndependent Model (T)=false2025.11 | 37.8 | 31.4 | 32.8 | |
| GPT-4o + MediSeeIndependent Model (T)=false2025.11 | 33.4 | 26.8 | 28.9 | |
| SegLLM-13BIndependent Model (T)=true2025.11 | 33 | 24.6 | 33.9 | |
| Human-Thinking + MedPLIBIndependent Model (T)=false2025.11 | 32 | 25.2 | 23.4 | |
| SegLLM-7BIndependent Model (T)=true2025.11 | 30.4 | 22.2 | 31 | |
| Human-Thinking + IMIS-NetIndependent Model (T)=false2025.11 | 26.4 | 21 | 25.3 | |
| Qwen3-VL + IMIS-NetIndependent Model (T)=false2025.11 | 23.4 | 18.3 | 20.1 | |
| Gemini-2.5-Pro + IMIS-NetIndependent Model (T)=false2025.11 | 21.9 | 17 | 19.2 | |
| GPT-4o + IMIS-NetIndependent Model (T)=false2025.11 | 17.4 | 15.2 | 21.2 | |
| Human-Thinking + BiomedParseIndependent Model (T)=false2025.11 | 11.3 | 10.2 | 8.4 |