Joint Retrieval on English-translated WeChat (test)
59.07PrecisionClaude-3.5
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Claude-3.5zero-shot inference=true, MLDR fine-tuning=false2026.06 | 59.07 | 47.49 | 53.32 | 47.32 | |
| GPT-4ozero-shot inference=true, MLDR fine-tuning=false2026.06 | 58.47 | 44.61 | 51.43 | 45.99 | |
| Gemini-1.5zero-shot inference=true, MLDR fine-tuning=false2026.06 | 55.83 | 33.99 | 43.2 | 38.06 | |
| F2RVLM-Qwen2-VL-7BMLDR fine-tuning=true2026.06 | 55.54 | 58.44 | 57.49 | 50.69 | |
| Mimo-7B-RLMLDR fine-tuning=true2026.06 | 47.44 | 39.39 | 43.49 | 36.77 | |
| Qwen2-VL-7BMLDR fine-tuning=true2026.06 | 42.73 | 57.64 | 49.28 | 40.57 | |
| Qwen2.5-VL-7BMLDR fine-tuning=true2026.06 | 39.22 | 65.59 | 49.5 | 41.09 | |
| DeepSeek-VL2-Small-16BMLDR fine-tuning=true2026.06 | 35.89 | 11.67 | 17.69 | 15.35 | |
| F2RVLM-Qwen2.5-VL-3BMLDR fine-tuning=true2026.06 | 35.21 | 71.6 | 47.85 | 39.8 | |
| Qwen2.5-VL-72Bzero-shot inference=true, MLDR fine-tuning=false2026.06 | 32.15 | 44.64 | 38.94 | 29.08 | |
| Qwen2.5-VL-3BMLDR fine-tuning=true2026.06 | 28.15 | 74.46 | 41.51 | 32.68 | |
| F2RVLM-Qwen2-VL-2BMLDR fine-tuning=true2026.06 | 21.68 | 82.13 | 35.81 | 26.14 | |
| Qwen2-VL-2BMLDR fine-tuning=true2026.06 | 20.17 | 83.72 | 34.01 | 23.64 | |
| mPLUG-Owl3-2BMLDR fine-tuning=true2026.06 | 19.11 | 21.59 | 20.33 | 7.64 |