Context-Aware Video Speech Recognition (CAVSR) on Chinese-LiPS
1.8CERVASR
Evaluation Results
| Method | Links | |
|---|---|---|
| VASRParameters=7B, Input Modality=A/V2026.03 | 1.8 | |
| Doubao ASRParameters=-, Input Modality=A2026.03 | 3.47 | |
| Qwen3Omni-Instruct-30B-A3BParameters=30B, Input Modality=A/V2026.03 | 4.41 | |
| Gemini2.5ProParameters=-, Input Modality=A/V2026.03 | 4.59 | |
| Qwen3Omni-Thinking-30B-A3BParameters=30B, Input Modality=A/V2026.03 | 7.56 | |
| Qwen2.5Omni-7BParameters=7B, Input Modality=A2026.03 | 11.71 | |
| Qwen2.5Omni-7BParameters=7B, Input Modality=A/V2026.03 | 22.45 | |
| Qwen2.5Omni-3BParameters=3B, Input Modality=A/V2026.03 | 27.89 | |
| Intern-S1Parameters=9B, Input Modality=A/V2026.03 | 71.94 | |
| MiniCPM-o2.6Parameters=8B, Input Modality=A/V2026.03 | 73.92 |