Continuous Sign Language Recognition on PHOENIX-2014 (test)
17.7WERC2ST
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| C2STGroups=Group 3, Extra Cues=None2023.05 | 17.7 | 4.2 | 3 | |
| DCAGroups=Group 4, Extra Cues=None2023.05 | 17.7 | 4.4 | 2.8 | |
| TwoStream-SLR (Ours)Modality=RGB + Pose2022.11 | 18.8 | — | — | |
| TwoStream-SLRGroups=Group 1, Extra Cues=Keypoints2023.05 | 18.8 | — | — | |
| SignGraphGroups=Group 1, Extra Cues=None2023.05 | 19.1 | — | — | |
| CorrNetexploit hand and face features=true2023.03 | 19.4 | — | — | |
| CorrNetBackbone=ResNet18, Extra clues=false2023.03 | 19.4 | 5.7 | 2.3 | |
| CorrNetGroups=Group 1, Extra Cues=None2023.05 | 19.4 | 5.7 | 2.3 | |
| TB-NetGroups=Group 1, Extra Cues=None2023.05 | 19.6 | — | — | |
| SignBERT+Modality=RGB-based2023.05 | 20 | 4.2 | 3.8 | |
| SignBERT+Groups=Group 1, Extra Cues=None2023.05 | 20 | 4.2 | 3.8 | |
| CoSignGroups=Group 1, Extra Cues=None2023.05 | 20.1 | — | — | |
| CVT-SLRGroups=Group 2, Extra Cues=None2023.05 | 20.1 | 6.1 | 2.3 | |
| CTCAGroups=Group 2, Extra Cues=None2023.05 | 20.1 | 6.1 | 2.6 | |
| SGNGroups=Group 1, Extra Cues=None2023.05 | 20.2 | 5.3 | 2.8 | |
| RadialCTCGroups=Group 1, Extra Cues=None2023.05 | 20.2 | 6.1 | 2.6 | |
| C2SLRBackbone=ResNet18, Extra clues (face or hand features)=true2022.11 | 20.4 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues (face or hand features)=true2022.11 | 20.4 | — | — | |
| C2SLR (RGB+Pose)Modality=RGB + Pose2022.11 | 20.4 | — | — | |
| C2SLRexploit hand and face features=true2023.03 | 20.4 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues=true2023.03 | 20.4 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues=true2023.03 | 20.4 | — | — | |
| C2SLRBackbone=ResNet18, GFLOPS per video=367, Extra Modalities=Face and Hands2023.08 | 20.4 | — | — | |
| C2SLRBackbone=ResNet18, GFLOPS per video=367, Extra Modalities=Face and Hands2023.08 | 20.4 | — | — | |
| C2SLREnd-to-end=true, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 20.4 | — | — | |
| C2SLREnd-to-end=true, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 20.4 | — | — | |
| C2SLRGroups=Group 1, Extra Cues=Keypoints2023.05 | 20.4 | — | — | |
| GPGNGroups=Group 2, Extra Cues=None2023.05 | 20.4 | 6.3 | 2.8 | |
| CorrNetBackbone=ResNet18, Extra clues=false2023.03 | 20.5 | — | — | |
| AdaBrowsealpha=0.04, GFLOPS=287, Throughput (videos/s)=12.312023.08 | 20.5 | — | — | |
| AdaBrowse+alpha=0.05, GFLOPS=241, Throughput (videos/s)=15.122023.08 | 20.5 | — | — | |
| AdaBrowsealpha=0.04, GFLOPS=287, Throughput (videos/s)=12.312023.08 | 20.5 | — | — | |
| AdaBrowse+alpha=0.05, GFLOPS=241, Throughput (videos/s)=15.122023.08 | 20.5 | — | — | |
| AdaBrowseBackbone=ResNet18, GFLOPS per video=2542023.08 | 20.6 | — | — | |
| AdaBrowse+Backbone=ResNet18, GFLOPS per video=1712023.08 | 20.6 | — | — | |
| AdaBrowsealpha=0.15, GFLOPS=254, Throughput (videos/s)=14.262023.08 | 20.6 | — | — | |
| AdaBrowse+alpha=0.1, GFLOPS=171, Throughput (videos/s)=17.582023.08 | 20.6 | — | — | |
| STMCfull-frame=true, hand-cue=true, face-cue=true, pose-cue=true2020.02 | 20.7 | 7.4 | 2.6 | |
| STMCBackbone=VGG11, Extra clues (face or hand features)=true2022.11 | 20.7 | 7.4 | 2.6 | |
| SENBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 20.7 | — | — | |
| STMC-R (RGB+Pose)Modality=RGB + Pose2022.11 | 20.7 | — | — | |
| STMCexploit hand and face features=true2023.03 | 20.7 | — | — | |
| STMCBackbone=VGG11, Extra clues=true2023.03 | 20.7 | 7.4 | 2.6 | |
| SENBackbone=ResNet18, Extra clues=false2023.03 | 20.7 | — | — | |
| STMCModality=RGB-based2023.05 | 20.7 | 7.4 | 2.6 | |
| STMCBackbone=VGG11, GFLOPS per video=1554, Extra Modalities=Face and Hands2023.08 | 20.7 | 7.4 | 2.6 | |
| AdaBrowse+Backbone=ResNet18, GFLOPS per video=1712023.08 | 20.7 | 5.9 | 2.6 | |
| SENBackbone=ResNet18, GFLOPS per video=3672023.08 | 20.7 | — | — | |
| AdaBrowse+alpha=0.1, GFLOPS=171, Throughput (videos/s)=17.582023.08 | 20.7 | — | — | |
| STMCEnd-to-end=false, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 20.7 | — | — | |
| TLPBackbone=ResNet18, Extra clues=false2023.03 | 20.8 | 6.1 | 2.9 | |
| TLPBackbone=ResNet18, GFLOPS per video=3672023.08 | 20.8 | 6.1 | 2.9 | |
| AdaBrowseBackbone=ResNet18, GFLOPS per video=2542023.08 | 20.8 | 6 | 2.8 | |
| AdaBrowsealpha=0.15, GFLOPS=254, Throughput (videos/s)=14.262023.08 | 20.8 | — | — | |
| BaselineGFLOPS=364, Throughput (videos/s)=12.222023.08 | 20.8 | — | — | |
| TLPGroups=Group 1, Extra Cues=None2023.05 | 20.8 | 6.1 | 2.9 | |
| BaselineGFLOPS=364, Throughput (videos/s)=12.222023.08 | 20.9 | — | — | |
| STMCCues=full-frame + mouth + hand2020.02 | 21 | — | — | |
| SMKDBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 21 | 6.3 | 2.3 | |
| SENBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 21 | 7.3 | 4 | |
| STMCBackbone=VGG11, Extra clues (face or hand features)=true2022.11 | 21 | — | — | |
| SMKDModality=RGB2022.11 | 21 | — | — | |
| SMKDBackbone=ResNet18, Extra clues=false2023.03 | 21 | 6.3 | 2.3 | |
| SENBackbone=ResNet18, Extra clues=false2023.03 | 21 | 7.3 | 4 | |
| STMCBackbone=VGG11, Extra clues=true2023.03 | 21 | — | — | |
| SMKDBackbone=ResNet18, GFLOPS per video=3672023.08 | 21 | 6.3 | 2.3 | |
| SENBackbone=ResNet18, GFLOPS per video=3672023.08 | 21 | 7.3 | 4 | |
| STMCBackbone=VGG11, GFLOPS per video=1554, Extra Modalities=Face and Hands2023.08 | 21 | — | — | |
| SMKDEnd-to-end=false, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21 | — | — | |
| STMCEnd-to-end=false, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 21 | — | — | |
| SMKDGroups=Group 1, Extra Cues=None2023.05 | 21 | 6.3 | 2.3 | |
| SENGroups=Group 1, Extra Cues=None2023.05 | 21 | 7.3 | 4 | |
| TLPBackbone=ResNet18, Extra clues=false2023.03 | 21.2 | — | — | |
| TLPBackbone=ResNet18, GFLOPS per video=3672023.08 | 21.2 | — | — | |
| CMABackbone=GoogLeNet, Extra clues (face or hand features)=false2022.11 | 21.9 | 7.3 | 2.4 | |
| LCSAModality=RGB2022.11 | 21.9 | — | — | |
| CMAModality=RGB2022.11 | 21.9 | — | — | |
| CMABackbone=GoogLeNet, Extra clues=false2023.03 | 21.9 | 7.3 | 2.4 | |
| CMAModality=RGB-based2023.05 | 21.9 | 7.3 | 2.4 | |
| CMABackbone=GoogLeNet, GFLOPS per video=3162023.08 | 21.9 | 7.3 | 2.4 | |
| CMAEnd-to-end=false, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21.9 | — | — | |
| LCSAEnd-to-end=true, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21.9 | — | — | |
| CMAGroups=Group 2, Extra Cues=None2023.05 | 21.9 | 7.3 | 2.4 | |
| VACBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 22.3 | 8.4 | 2.6 | |
| BaselineBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 22.3 | 8.4 | 2.6 | |
| VACModality=RGB2022.11 | 22.3 | — | — | |
| VACBackbone=ResNet18, Extra clues=false2023.03 | 22.3 | 8.4 | 2.6 | |
| VACModality=RGB-based2023.05 | 22.3 | 8.4 | 2.6 | |
| VACBackbone=ResNet18, GFLOPS per video=3672023.08 | 22.3 | 8.4 | 2.6 | |
| VACEnd-to-end=true, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 22.3 | — | — | |
| VACGroups=Group 1, Extra Cues=None2023.05 | 22.3 | 8.4 | 2.6 | |
| SMCfull-frame=true, hand-cue=true, face-cue=true, pose-cue=true2020.02 | 22.4 | 7.4 | 3.5 | |
| SMKDBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 22.4 | — | — | |
| SMKDBackbone=ResNet18, Extra clues=false2023.03 | 22.4 | — | — | |
| SMKDBackbone=ResNet18, GFLOPS per video=3672023.08 | 22.4 | — | — | |
| SMKDEnd-to-end=false, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 22.4 | — | — | |
| MMTLBEnd-to-end=true, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 22.5 | — | — | |
| BaselineBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 22.8 | — | — | |
| DNFfull-frame=true, modality=RGB+Flow2020.02 | 22.9 | 6.7 | 3.3 | |
| DNFBackbone=GoogLeNet, Extra clues (face or hand features)=true2022.11 | 22.9 | 6.7 | 3.3 |