Medical Report Generation on Parkinson's Screening Dataset
82.5Classification AccuracyYOLOv11 + MLGE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| YOLOv11 + MLGEOriginal Input=YOLOv11 + MLGE embeddings + metadata, Architecture=Encoder-Decoder, Optimization=Optimized vision-to-language mapping2025.12 | 82.5 | 4.2 | |
| YOLOv11 + MLGEOriginal Input=YOLOv11 + MLGE embeddings + metadata, Architecture=Encoder-Decoder2025.12 | 78 | 3.8 | |
| MedVisionLlamaOriginal Input=CNN embeddings + metadata, Architecture=Encode-only2025.12 | 77.5 | 3.7 | |
| VLMTOriginal Input=ViT visual tokens (no metadata), Architecture=Decoder-only2025.12 | 74 | 3.5 | |
| MedVisionLlamaOriginal Input=CNN embeddings only, Architecture=Encode-only2025.12 | 72 | 3.2 | |
| YOLOv11 + MLGEOriginal Input=YOLOv11 + MLGE embeddings only, Architecture=Encoder-Decoder2025.12 | 70 | 3.1 | |
| MedVLMOriginal Input=Raw RGB-D frames directly into multimodal LLM, Architecture=Decoder-only2025.12 | 65 | 2.8 |