Video Detail Captioning on VDC
1.8Camera Component ScoreSynPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SynPOModel Backbone=InternVL2-8B, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.8 | 1.96 | 1.95 | 1.97 | 2.04 | 2.48 | |
| SynPOModel Backbone=AuroraCap, Fine-tuning Dataset=Pandas-70M2025.06 | 1.79 | 1.94 | 1.91 | 1.89 | 2.06 | 2.44 | |
| SynPOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.78 | 1.94 | 1.91 | 1.87 | 2.04 | 2.43 | |
| SynPO-v3Model Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.75 | 1.91 | 1.9 | 1.84 | 2.05 | 2.38 | |
| SynPOModel Backbone=AuroraCap, Fine-tuning Dataset=Charades2025.06 | 1.75 | 1.95 | 1.88 | 1.88 | 2.02 | 2.41 | |
| SynPO-v2Model Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.74 | 1.93 | 1.88 | 1.87 | 2.03 | 2.37 | |
| SynPOModel Backbone=LLaVA1.6-7B-video, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.74 | 1.9 | 1.94 | 1.85 | 2 | 2.36 | |
| SynPO-v1Model Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.72 | 1.89 | 1.87 | 1.83 | 2.02 | 2.35 | |
| SynPO-v5Model Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.57 | 1.78 | 1.82 | 1.77 | 1.97 | 2.29 | |
| DPOPModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.55 | 1.88 | 1.78 | 1.79 | 1.96 | 2.3 | |
| KTOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.53 | 1.88 | 1.73 | 1.78 | 1.97 | 2.27 | |
| SimPOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.52 | 1.83 | 1.76 | 1.75 | 1.96 | 2.26 | |
| SynPO-v4Model Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.48 | 1.87 | 1.8 | 1.75 | 1.98 | 2.25 | |
| SFTModel Backbone=InternVL2-8B, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.46 | 1.88 | 1.77 | 1.83 | 1.93 | 2.26 | |
| SFTModel Backbone=AuroraCap, Fine-tuning Dataset=Pandas-70M2025.06 | 1.45 | 1.86 | 1.71 | 1.74 | 1.92 | 2.22 | |
| DPOModel Backbone=LLaVA1.6-7B-video, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.45 | 1.87 | 1.71 | 1.72 | 1.9 | 2.19 | |
| IPOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.44 | 1.83 | 1.74 | 1.76 | 1.95 | 2.21 | |
| DPOModel Backbone=AuroraCap, Fine-tuning Dataset=Pandas-70M2025.06 | 1.44 | 1.88 | 1.75 | 1.75 | 1.93 | 2.25 | |
| DPOModel Backbone=InternVL2-8B, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.44 | 1.92 | 1.82 | 1.89 | 1.91 | 2.31 | |
| SFTModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.43 | 1.85 | 1.73 | 1.72 | 1.91 | 2.18 | |
| CPOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.42 | 1.81 | 1.75 | 1.72 | 1.94 | 2.25 | |
| DPOModel Backbone=AuroraCap, Fine-tuning Dataset=Charades2025.06 | 1.41 | 1.88 | 1.66 | 1.73 | 1.92 | 2.19 | |
| SFTModel Backbone=AuroraCap, Fine-tuning Dataset=Charades2025.06 | 1.4 | 1.87 | 1.68 | 1.75 | 1.9 | 2.21 | |
| DPOModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.39 | 1.89 | 1.7 | 1.73 | 1.94 | 2.23 | |
| SFTModel Backbone=LLaVA1.6-7B-video, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.37 | 1.83 | 1.72 | 1.66 | 1.88 | 2.13 | |
| BaseModel Backbone=InternVL2-8B, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.26 | 1.83 | 1.66 | 1.64 | 1.69 | 2.15 | |
| BaseModel Backbone=AuroraCap, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.22 | 1.79 | 1.58 | 1.45 | 1.7 | 2 | |
| BaseModel Backbone=LLaVA1.6-7B-video, Fine-tuning Dataset=Sharegpt4video2025.06 | 1.14 | 1.75 | 1.63 | 1.41 | 1.63 | 1.89 |