Continuous Sign Language Recognition on PHOENIX 2014 (dev)
17.3Word Error RateDCA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DCAGroups=Group 4, Extra Cues=None2023.05 | 17.3 | 4.5 | 2.5 | |
| C2STGroups=Group 3, Extra Cues=None2023.05 | 17.5 | 4.2 | 3 | |
| TwoStream-SLR (Ours)Modality=RGB + Pose2022.11 | 17.7 | — | — | |
| SignGraphGroups=Group 1, Extra Cues=None2023.05 | 18.2 | — | — | |
| TwoStream-SLR (Ours)Modality=RGB + Pose2022.11 | 18.4 | — | — | |
| TwoStream-SLRGroups=Group 1, Extra Cues=Keypoints2023.05 | 18.4 | — | — | |
| CorrNetexploit hand and face features=true2023.03 | 18.8 | — | — | |
| CorrNetBackbone=ResNet18, Extra clues=false2023.03 | 18.8 | 5.6 | 2.8 | |
| CorrNetGroups=Group 1, Extra Cues=None2023.05 | 18.8 | 5.6 | 2.8 | |
| CorrNetBackbone=ResNet18, Extra clues=false2023.03 | 18.9 | — | — | |
| TB-NetGroups=Group 1, Extra Cues=None2023.05 | 18.9 | — | — | |
| SENBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 19.3 | — | — | |
| SENBackbone=ResNet18, Extra clues=false2023.03 | 19.3 | — | — | |
| TLPBackbone=ResNet18, Extra clues=false2023.03 | 19.4 | — | — | |
| AdaBrowsealpha=0.04, GFLOPS=287, Throughput (videos/s)=12.312023.08 | 19.4 | — | — | |
| AdaBrowse+alpha=0.05, GFLOPS=241, Throughput (videos/s)=15.122023.08 | 19.4 | — | — | |
| RadialCTCGroups=Group 1, Extra Cues=None2023.05 | 19.4 | 6.5 | 2.7 | |
| SENBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 19.5 | 5.8 | 2.6 | |
| SENBackbone=ResNet18, Extra clues=false2023.03 | 19.5 | 5.8 | 2.6 | |
| SENBackbone=ResNet18, GFLOPS per video=3672023.08 | 19.5 | 5.8 | 2.6 | |
| SENGroups=Group 1, Extra Cues=None2023.05 | 19.5 | 5.8 | 2.6 | |
| SGNGroups=Group 1, Extra Cues=None2023.05 | 19.5 | 5.1 | 3.1 | |
| CTCAGroups=Group 2, Extra Cues=None2023.05 | 19.5 | 6.2 | 2.9 | |
| STMCCues=full-frame + mouth + hand2020.02 | 19.6 | — | — | |
| STMCBackbone=VGG11, Extra clues (face or hand features)=true2022.11 | 19.6 | — | — | |
| STMC-R (RGB+Pose)Modality=RGB + Pose2022.11 | 19.6 | — | — | |
| STMCBackbone=VGG11, Extra clues=true2023.03 | 19.6 | — | — | |
| AdaBrowseBackbone=ResNet18, GFLOPS per video=2542023.08 | 19.6 | 6 | 2.6 | |
| AdaBrowse+Backbone=ResNet18, GFLOPS per video=1712023.08 | 19.6 | 6 | 2.5 | |
| AdaBrowsealpha=0.15, GFLOPS=254, Throughput (videos/s)=14.262023.08 | 19.6 | — | — | |
| AdaBrowse+alpha=0.1, GFLOPS=171, Throughput (videos/s)=17.582023.08 | 19.6 | — | — | |
| TLPBackbone=ResNet18, Extra clues=false2023.03 | 19.7 | 6.3 | 2.8 | |
| TLPBackbone=ResNet18, GFLOPS per video=3672023.08 | 19.7 | 6.3 | 2.8 | |
| BaselineGFLOPS=364, Throughput (videos/s)=12.222023.08 | 19.7 | — | — | |
| TLPGroups=Group 1, Extra Cues=None2023.05 | 19.7 | 6.3 | 2.8 | |
| CoSignGroups=Group 1, Extra Cues=None2023.05 | 19.7 | — | — | |
| CVT-SLRGroups=Group 2, Extra Cues=None2023.05 | 19.8 | 6.4 | 2.6 | |
| SignBERT+Modality=RGB-based2023.05 | 19.9 | 4.8 | 3.7 | |
| SignBERT+Groups=Group 1, Extra Cues=None2023.05 | 19.9 | 4.8 | 3.7 | |
| GPGNGroups=Group 2, Extra Cues=None2023.05 | 19.9 | 5.8 | 3.6 | |
| C2SLRBackbone=ResNet18, Extra clues (face or hand features)=true2022.11 | 20.2 | — | — | |
| C2SLR (RGB+Pose)Modality=RGB + Pose2022.11 | 20.2 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues=true2023.03 | 20.2 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues (face or hand features)=true2022.11 | 20.5 | — | — | |
| C2SLR (RGB+Pose)Modality=RGB + Pose2022.11 | 20.5 | — | — | |
| C2SLRexploit hand and face features=true2023.03 | 20.5 | — | — | |
| C2SLRBackbone=ResNet18, Extra clues=true2023.03 | 20.5 | — | — | |
| C2SLRBackbone=ResNet18, GFLOPS per video=367, Extra Modalities=Face and Hands2023.08 | 20.5 | — | — | |
| C2SLREnd-to-end=true, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 20.5 | — | — | |
| C2SLRGroups=Group 1, Extra Cues=Keypoints2023.05 | 20.5 | — | — | |
| SMKDBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 20.8 | 6.8 | 2.5 | |
| SMKDBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 20.8 | — | — | |
| SMKDModality=RGB2022.11 | 20.8 | — | — | |
| SMKDModality=RGB2022.11 | 20.8 | — | — | |
| SMKDBackbone=ResNet18, Extra clues=false2023.03 | 20.8 | 6.8 | 2.5 | |
| SMKDBackbone=ResNet18, Extra clues=false2023.03 | 20.8 | — | — | |
| SMKDBackbone=ResNet18, GFLOPS per video=3672023.08 | 20.8 | 6.8 | 2.5 | |
| SMKDEnd-to-end=false, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 20.8 | — | — | |
| SMKDGroups=Group 1, Extra Cues=None2023.05 | 20.8 | 6.8 | 2.5 | |
| STMCfull-frame=true, hand-cue=true, face-cue=true, pose-cue=true2020.02 | 21.1 | 7.7 | 3.4 | |
| STMCBackbone=VGG11, Extra clues (face or hand features)=true2022.11 | 21.1 | 7.7 | 3.4 | |
| BaselineBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 21.1 | — | — | |
| STMC-R (RGB+Pose)Modality=RGB + Pose2022.11 | 21.1 | — | — | |
| STMCexploit hand and face features=true2023.03 | 21.1 | — | — | |
| STMCBackbone=VGG11, Extra clues=true2023.03 | 21.1 | 7.7 | 3.4 | |
| STMCBackbone=VGG11, GFLOPS per video=1554, Extra Modalities=Face and Hands2023.08 | 21.1 | 7.7 | 3.4 | |
| STMCEnd-to-end=false, Modalities (Training)=R+P, Modalities (Inference)=R2022.12 | 21.1 | — | — | |
| STMCBackbone=VGG11, Iteration=true, Extra clues=true2021.04 | 21.1 | 7.7 | 3.4 | |
| VACBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 21.2 | 7.9 | 2.5 | |
| BaselineBackbone=ResNet18, Extra clues (face or hand features)=false2022.11 | 21.2 | 7.9 | 2.5 | |
| VACModality=RGB2022.11 | 21.2 | — | — | |
| VACBackbone=ResNet18, Extra clues=false2023.03 | 21.2 | 7.9 | 2.5 | |
| VACModality=RGB-based2023.05 | 21.2 | 7.9 | 2.5 | |
| VACBackbone=ResNet18, GFLOPS per video=3672023.08 | 21.2 | 7.9 | 2.5 | |
| VACEnd-to-end=true, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21.2 | — | — | |
| VACGroups=Group 1, Extra Cues=None2023.05 | 21.2 | 7.9 | 2.5 | |
| Baseline+VACBackbone=ResNet18, Gloss-wise temporal layer=true2021.04 | 21.2 | 7.9 | 2.5 | |
| CMABackbone=GoogLeNet, Extra clues (face or hand features)=false2022.11 | 21.3 | 7.3 | 2.7 | |
| CMAModality=RGB2022.11 | 21.3 | — | — | |
| CMABackbone=GoogLeNet, Extra clues=false2023.03 | 21.3 | 7.3 | 2.7 | |
| CMAModality=RGB-based2023.05 | 21.3 | 7.3 | 2.7 | |
| CMABackbone=GoogLeNet, GFLOPS per video=3162023.08 | 21.3 | 7.3 | 2.7 | |
| CMAEnd-to-end=false, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21.3 | — | — | |
| CMAGroups=Group 2, Extra Cues=None2023.05 | 21.3 | 7.3 | 2.7 | |
| CMABackbone=GoogLeNet, Iteration=true2021.04 | 21.3 | 7.3 | 2.7 | |
| LCSAModality=RGB2022.11 | 21.4 | — | — | |
| LCSAEnd-to-end=true, Modalities (Training)=R, Modalities (Inference)=R2022.12 | 21.4 | — | — | |
| STMCModality=RGB-based2023.05 | 21.7 | 7.7 | 2.4 | |
| MMTLBModality=RGB2022.11 | 21.9 | — | — | |
| CNN-LSTM-HMMCues=full-frame + mouth + hand (f+m+h), Streams=32020.02 | 22.1 | — | — | |
| CNN+LSTM+HMMBackbone=GoogLeNet, Extra clues (face or hand features)=true2022.11 | 22.1 | — | — | |
| CNN-LSTM-HMMs (Multi-Stream)Modality=RGB + hand/mouth shape2022.11 | 22.1 | — | — | |
| CNN+LSTM+HMMBackbone=GoogLeNet, Extra clues=true2023.03 | 22.1 | — | — | |
| SMCfull-frame=true, hand-cue=true, face-cue=true, pose-cue=true2020.02 | 22.7 | 7.6 | 3.8 | |
| SignBTModality=RGB2022.11 | 22.7 | — | — | |
| DNFfull-frame=true, modality=RGB+Flow2020.02 | 23.1 | 7.3 | 3.3 | |
| DNFBackbone=GoogLeNet, Extra clues (face or hand features)=true2022.11 | 23.1 | 7.3 | 3.3 | |
| DNF (RGB+Flow)Modality=RGB + Flow2022.11 | 23.1 | — | — | |
| DNFexploit hand and face features=true2023.03 | 23.1 | — | — | |
| DNFBackbone=GoogLeNet, Extra clues=true2023.03 | 23.1 | 7.3 | 3.3 |