Biomedical Multimodal Reasoning on LAB-Bench
81.82Cloning ScoreBioManus
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| BioManus2026.06 | 81.82 | 67.29 | — | — | — | 90.48 | — | — | — | |
| Biomni2026.06 | 78.79 | 57.46 | — | — | — | 84.76 | — | — | — | |
| Biomnivariant=5002026.06 | 75.76 | 72.79 | — | — | — | 74.92 | — | — | — | |
| Biomnivariant=1k2026.06 | 75.76 | 65.15 | — | — | — | 72.88 | — | — | — | |
| Biomnivariant=2k2026.06 | 72.73 | 60.8 | — | — | — | 77.27 | — | — | — | |
| Biomnivariant=1002026.06 | 69.7 | 75.35 | — | — | — | 79.37 | — | — | — | |
| Human Expert2026.06 | 60 | 74.7 | — | — | — | 78.8 | — | — | — | |
| DeepSeek-V42026.06 | 39.39 | 27.3 | — | — | — | 49.84 | — | — | — | |
| BioVLM-8BBase Model=Qwen3-VL-8B, Training Strategy=SFT + GRPO2026.05 | 38.4 | 48.9 | 35.2 | 65.5 | 72.3 | 42.8 | 44.2 | 45.6 | 48 | |
| GPT 5.22026.05 | 36.4 | 41.7 | 36.5 | 45.7 | 65.7 | 47 | 48.8 | 36.9 | 44.2 | |
| ReAct-Code2026.06 | 36.36 | 27.62 | — | — | — | 43.49 | — | — | — | |
| BioVLM-8B (SFT only)Base Model=Qwen3-VL-8B, Training Strategy=SFT only2026.05 | 34.5 | 44.7 | 31.8 | 58.2 | 68.1 | 39.5 | 40.9 | 40.3 | 43.7 | |
| PubMed SFTFine-tuning Dataset=PubMedQA, Base Model=Qwen3-VL-8B2026.05 | 33.3 | 14 | 18 | 38 | 46 | 34 | 30 | 22 | 26.6 | |
| GPT 5.1mModel Size=mini2026.05 | 30.3 | 40.6 | 26.5 | 50.8 | 63 | 36.2 | 36.6 | 34 | 39.1 | |
| Biomni-ReAct2026.06 | 24.24 | 28.11 | — | — | — | 74.6 | — | — | — | |
| Qwen3 VL-8BBase Model=Qwen3-VL-8B2026.05 | 24.2 | 31.2 | 24.7 | 38.7 | 38.3 | 43.4 | 24.8 | 34 | 35.4 | |
| MedQA SFTFine-tuning Dataset=MedQA, Base Model=Qwen3-VL-8B2026.05 | 24.2 | 20 | 22 | 34 | 46 | 34 | 30 | 30 | 29 | |
| GPT-5.52026.06 | 21.21 | 23.7 | — | — | — | 16.96 | — | — | — |