Image Captioning on DenseFusion (test)
59.2CapArena Win Rate (vs Base Model)RubiCap-3B-DenseFusion
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| RubiCap-3B-DenseFusionFine-tuning strategy=GRPO, Training sample size=50k, Training Dataset=DenseFusion Dataset, Reward signal type=RubiCap2026.03 | 59.2 | 26.2 | 59.67 | 69.33 | 27.2 | 18.52 | 10.97 | 38.73 | |
| Direct-LikertFine-tuning strategy=GRPO, Training sample size=50k, Training Dataset=DenseFusion Dataset, Reward signal type=Direct-Likert2026.03 | 53.2 | 23.8 | 60.28 | 69.44 | 27.27 | 18.95 | 11.35 | 37.76 | |
| RubiCap-2B-DenseFusionFine-tuning Strategy=GRPO, Training Dataset=DenseFusion2026.03 | 52.4 | 22 | 58.14 | 63.54 | 26.59 | 16.91 | 9.47 | 35.58 | |
| NLP Metric-based RLFine-tuning strategy=GRPO, Training sample size=50k, Training Dataset=DenseFusion Dataset, Reward signal type=NLP Metric2026.03 | 50.8 | 19.4 | 60.91 | 77.14 | 28.68 | 20.54 | 12.74 | 38.6 | |
| Base Model (Qwen2-VL-2B-Instruct)Backbone=Qwen2-VL-2B-Instruct2026.03 | 50 | 19.4 | 59.8 | 67.49 | 26.96 | 19.03 | 11.6 | 36.33 | |
| Base Model (Qwen2.5-VL-3B-Instruct)Backbone=Qwen2.5-VL-3B-Instruct2026.03 | 50 | 20 | 58.68 | 68.03 | 25.73 | 18.84 | 11.06 | 36.05 | |
| Direct-LikertFine-tuning Strategy=GRPO, Training Dataset=DenseFusion2026.03 | 49.4 | 14.2 | 58.41 | 63.88 | 26.34 | 17.26 | 9.41 | 34.13 | |
| Reference-LikertFine-tuning strategy=GRPO, Training sample size=50k, Training Dataset=DenseFusion Dataset, Reward signal type=Reference-Likert2026.03 | 48.6 | 17.8 | 60.25 | 65.66 | 25.47 | 21.62 | 9.59 | 35.57 | |
| CapRL-3B2026.03 | 45.4 | 15.2 | 60.65 | 0 | 21.73 | 23.49 | 6.51 | 24.71 | |
| Reference-LikertFine-tuning Strategy=GRPO, Training Dataset=DenseFusion2026.03 | 42.2 | 13 | 58.34 | 64.2 | 25.91 | 18.05 | 10.39 | 33.16 | |
| NLP Metric-based RLFine-tuning Strategy=GRPO, Training Dataset=DenseFusion2026.03 | 40.8 | 13.2 | 59.84 | 72.5 | 28.06 | 19.1 | 11.45 | 34.99 |