Audiovisual Speech Recognition on manually annotated Catalan audiovisual (test)
18.3WERWhisper-large-v3
Evaluation Results
| Method | Links | |
|---|---|---|
| Whisper-large-v3Catalan Data=>1,883h, Parameters=1,550M2026.03 | 18.3 | |
| Our model (AV)Catalan Data=723h, Parameters=325M2026.03 | 19.6 | |
| Whisper-largeCatalan Data=1,883h, Parameters=1,550M2026.03 | 31.4 |