Medical Reasoning Segmentation on MR-MedSeg regular case (test)
63.3DiceMediRound + JCM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MediRound + JCMIndependent Model (T)=true2025.11 | 63.3 | 54.5 | 60.2 | |
| MediRoundIndependent Model (T)=true2025.11 | 61 | 52.1 | 58.9 | |
| MediRound + READIndependent Model (T)=true2025.11 | 60.3 | 51.4 | 57.6 | |
| Human-Thinking + MediSeeIndependent Model (T)=false2025.11 | 45.6 | 34.5 | 38.6 | |
| SegLLM-13BIndependent Model (T)=true2025.11 | 45.3 | 33.4 | 44 | |
| GPT-4o + MediSeeIndependent Model (T)=false2025.11 | 45.2 | 34.2 | 38 | |
| Qwen3-VL + MediSeeIndependent Model (T)=false2025.11 | 45.2 | 34.1 | 38 | |
| SegLLM-7BIndependent Model (T)=true2025.11 | 42.1 | 32.9 | 42.4 | |
| Gemini-2.5-Pro + MediSeeIndependent Model (T)=false2025.11 | 37.9 | 31.4 | 35.1 | |
| Human-Thinking + MedPLIBIndependent Model (T)=false2025.11 | 35 | 24.8 | 24.7 | |
| Human-Thinking + IMIS-NetIndependent Model (T)=false2025.11 | 33.7 | 30 | 42.6 | |
| Gemini-2.5-Pro + IMIS-NetIndependent Model (T)=false2025.11 | 33.6 | 29.5 | 35.2 | |
| Human-Thinking + BiomedParseIndependent Model (T)=false2025.11 | 28.6 | 22.1 | 19 | |
| Qwen3-VL + IMIS-NetIndependent Model (T)=false2025.11 | 25.1 | 22.3 | 26.2 | |
| GPT-4o + IMIS-NetIndependent Model (T)=false2025.11 | 23.8 | 18.7 | 20.8 |