Word-level Visual Speech Recognition on CAS-VSR-W1K Chinese (test)
0.557Top-1 AccuracyFeng et al.
Evaluation Results
| Method | Links | |
|---|---|---|
| Feng et al.Temporal Model=BiGRU, Video Hours=1572024.06 | 0.557 | |
| MTLAMTemporal Model=DC-TCN, Video Hours=1572024.06 | 0.543 | |
| MVMTemporal Model=MS-TCN, Video Hours=1572024.06 | 0.538 | |
| Born-AgainTemporal Model=MS-TCN, Video Hours=1572024.06 | 0.466 | |
| Ma et al.Temporal Model=DC-TCN, Video Hours=1572024.06 | 0.437 |