Phone Recognition on TIMIT (test)
17.3Frame Error RateSegmental RNN
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Segmental RNNLanguage Model=false, Speaker-Dependent Transform=true2016.03 | 17.3 | — | — | — | |
| Attention-based RNNLanguage Model=Built-in, Speaker-Dependent Transform=not specified2016.03 | 17.6 | — | — | — | |
| RNN transducerLanguage Model=Built-in, Speaker-Dependent Transform=not specified2016.03 | 17.7 | — | — | — | |
| CTCLanguage Model=false, Speaker-Dependent Transform=false2016.03 | 18.4 | — | — | — | |
| HMM-DNNLanguage Model=true, Speaker-Dependent Transform=true2016.03 | 18.5 | — | — | — | |
| Segmental RNNLanguage Model=false, Speaker-Dependent Transform=false2016.03 | 18.9 | — | — | — | |
| Discriminative segmental cascade + 2nd pass with various featuresLanguage Model=true, Speaker-Dependent Transform=false2016.03 | 19.9 | — | — | — | |
| Discriminative segmental cascadeLanguage Model=false, Speaker-Dependent Transform=true2016.03 | 21.7 | — | — | — | |
| Deep Segmental NNLanguage Model=false, Speaker-Dependent Transform=true2016.03 | 21.9 | — | — | — | |
| Boundary-factored SCRFLanguage Model=false, Speaker-Dependent Transform=false2016.03 | 26.5 | — | — | — | |
| Bidirectional LSTMArchitecture=250 cells, Layers=52015.04 | 29.1 | — | — | — | |
| Bidirectional iRNNArchitecture=500 neurons, Layers=52015.04 | 29.7 | — | — | — | |
| Bidirectional LSTMArchitecture=250 cells, Layers=22015.04 | 30.6 | — | — | — | |
| Bidirectional RNNArchitecture=500 neurons, Layers=22015.04 | 32.4 | — | — | — | |
| first-pass SCRFLanguage Model=true, Speaker-Dependent Transform=false2016.03 | 33.1 | — | — | — | |
| Bidirectional iRNNArchitecture=500 neurons, Layers=22015.04 | 33.2 | — | — | — | |
| iRNNArchitecture=500 neurons, Layers=52015.04 | 33.8 | — | — | — | |
| Bidirectional RNNArchitecture=500 neurons, Layers=52015.04 | 34.8 | — | — | — | |
| LSTMArchitecture=250 cells, Layers=22015.04 | 35.4 | — | — | — | |
| iRNNArchitecture=500 neurons, Layers=22015.04 | 35.5 | — | — | — | |
| RNNArchitecture=500 neurons, Layers=22015.04 | 36.2 | — | — | — | |
| LSTMArchitecture=250 cells, Layers=52015.04 | 36.2 | — | — | — | |
| RNNArchitecture=500 neurons, Layers=52015.04 | 37 | — | — | — | |
| AllosaurusTrain Machine (hrs)=2.6K*, Train Human (hrs)=02026.06 | — | — | — | 10 | |
| Espeak G2P Baseline2026.06 | — | — | — | 4.97 | |
| HuBERT PhonemeTrain Machine (hrs)=0.1K, Train Human (hrs)=02026.06 | — | — | — | 6.4 | |
| MultIPATrain Machine (hrs)=3.6K, Train Human (hrs)=02026.06 | — | — | — | 12.3 | |
| Optimal CurriculumTrain Machine (hrs)=0, Train Human (hrs)=40.82026.06 | — | — | — | 2.1 | |
| POWSMTrain Machine (hrs)=17.1K, Train Human (hrs)=02026.06 | — | — | — | 9.3 | |
| RecurrentAreas with ABS plasticityClasses C=39, MFCCs M=11, Pop. neurons Npop=14, Input dim. ninput=154, Area size n=2,250, Cap k (% sparsity)=732 (32.5%), Learning rate β=3.1×10−4, Epochs=132026.03 | — | 47.5 | 2.6 | — | |
| W2V2-eSpeakTrain Machine (hrs)=5.3K, Train Human (hrs)=02026.06 | — | — | — | 5.9 | |
| W2V2-VitouphyTrain Machine (hrs)=0, Train Human (hrs)=2.282026.06 | — | — | — | 6 | |
| WavLM HuPERTrain Machine (hrs)=0.1K, Train Human (hrs)=3.72026.06 | — | — | — | 6.7 |