Image Retrieval on WeChat English-translated (test)
64.75PrecisionMimo-7B-RL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Mimo-7B-RLMLDR fine-tuning=true2026.06 | 64.75 | 37.98 | 47.88 | 43.04 | |
| F2RVLM-Qwen2-VL-7BMLDR fine-tuning=true2026.06 | 62.15 | 63.94 | 63.03 | 56.15 | |
| Claude-3.5zero-shot inference=true, MLDR fine-tuning=false2026.06 | 59.05 | 59.62 | 59.33 | 51.83 | |
| DeepSeek-VL2-Small-16BMLDR fine-tuning=true2026.06 | 55.88 | 9.69 | 16.52 | 18.72 | |
| GPT-4ozero-shot inference=true, MLDR fine-tuning=false2026.06 | 53.69 | 62.98 | 57.96 | 49.74 | |
| Gemini-1.5zero-shot inference=true, MLDR fine-tuning=false2026.06 | 52.25 | 47.21 | 49.6 | 41.13 | |
| Qwen2-VL-7BMLDR fine-tuning=true2026.06 | 47.47 | 58.65 | 52.47 | 43 | |
| Qwen2.5-VL-7BMLDR fine-tuning=true2026.06 | 44.9 | 67.79 | 54.02 | 44.91 | |
| F2RVLM-Qwen2.5-VL-3BMLDR fine-tuning=true2026.06 | 42.11 | 73.08 | 53.43 | 44.6 | |
| Qwen2.5-VL-3BMLDR fine-tuning=true2026.06 | 34.47 | 72.6 | 46.75 | 36.5 | |
| Qwen2.5-VL-72Bzero-shot inference=true, MLDR fine-tuning=false2026.06 | 34.23 | 73.56 | 46.72 | 36.6 | |
| F2RVLM-Qwen2-VL-2BMLDR fine-tuning=true2026.06 | 29.8 | 78.37 | 43.18 | 32.78 | |
| Qwen2-VL-2BMLDR fine-tuning=true2026.06 | 27.57 | 81.25 | 41.17 | 30.58 | |
| mPLUG-Owl3-2BMLDR fine-tuning=true2026.06 | 16.71 | 29.81 | 21.42 | 5.13 |