Speech Reconstruction on AISHELL-2 Chinese
0.93SIMMOSS-Audio-Tokenizer
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MOSS-Audio-Tokenizerbps=4000, Frame rate=12.5, NVQ=322026.02 | 0.93 | 0.96 | 3.71 | 3.3 | |
| MOSS-Audio-Tokenizerbps=4000, Frame rate=12.5, NVQ=322026.03 | 0.93 | 0.96 | 3.71 | 3.3 | |
| MOSS-Audio-Tokenizerbps=3000, Frame rate=12.5, NVQ=242026.02 | 0.92 | 0.96 | 3.64 | 3.2 | |
| MOSS-Audio-Tokenizerbps=3000, Frame rate=12.5, NVQ=242026.03 | 0.92 | 0.96 | 3.64 | 3.2 | |
| MOSS-Audio-Tokenizerbps=2000, Frame rate=12.5, NVQ=162026.02 | 0.89 | 0.94 | 3.46 | 2.96 | |
| MOSS-Audio-Tokenizerbps=2000, Frame rate=12.5, NVQ=162026.03 | 0.89 | 0.94 | 3.46 | 2.96 | |
| Qwen3-TTS-Tokenizerbps=2200, Frame rate=12.5, NVQ=162026.02 | 0.88 | 0.93 | 3.1 | 2.62 | |
| Qwen3-TTS-Tokenizerbps=2200, Frame rate=12.5, NVQ=162026.03 | 0.88 | 0.93 | 3.1 | 2.62 | |
| MOSS-Audio-Tokenizerbps=1500, Frame rate=12.5, NVQ=122026.02 | 0.86 | 0.93 | 3.27 | 2.74 | |
| MOSS-Audio-Tokenizerbps=1500, Frame rate=12.5, NVQ=122026.03 | 0.86 | 0.93 | 3.27 | 2.74 | |
| MiMo-Audio-Tokenizerbps=3650, Frame rate=25, NVQ=202026.02 | 0.85 | 0.93 | 3.44 | 2.89 | |
| MiMo-Audio-Tokenizerbps=3650, Frame rate=25, NVQ=202026.03 | 0.85 | 0.93 | 3.44 | 2.89 | |
| DACbps=6000, Frame rate=75, NVQ=82026.02 | 0.84 | 0.94 | 3.57 | 3.2 | |
| DACbps=6000, Frame rate=75, NVQ=82026.03 | 0.84 | 0.94 | 3.57 | 3.2 | |
| Higgs-Audio-Tokenizerbps=2000, Frame rate=25, NVQ=82026.02 | 0.83 | 0.85 | 3.22 | 2.73 | |
| MiMo-Audio-Tokenizerbps=2250, Frame rate=25, NVQ=122026.02 | 0.83 | 0.92 | 3.25 | 2.71 | |
| Mimibps=4400, Frame rate=12.5, NVQ=322026.02 | 0.83 | 0.94 | 3.31 | 2.78 | |
| Higgs-Audio-Tokenizerbps=2000, Frame rate=25, NVQ=82026.03 | 0.83 | 0.85 | 3.22 | 2.73 | |
| MiMo-Audio-Tokenizerbps=2250, Frame rate=25, NVQ=122026.03 | 0.83 | 0.92 | 3.25 | 2.71 | |
| Mimibps=4400, Frame rate=12.5, NVQ=322026.03 | 0.83 | 0.94 | 3.31 | 2.78 | |
| MOSS-Audio-Tokenizerbps=1000, Frame rate=12.5, NVQ=82026.02 | 0.81 | 0.91 | 2.96 | 2.43 | |
| MOSS-Audio-Tokenizerbps=1000, Frame rate=12.5, NVQ=82026.03 | 0.81 | 0.91 | 2.96 | 2.43 | |
| XY-Tokenizerbps=1000, Frame rate=12.5, NVQ=82026.02 | 0.79 | 0.87 | 2.63 | 2.12 | |
| XY-Tokenizerbps=1000, Frame rate=12.5, NVQ=82026.03 | 0.79 | 0.87 | 2.63 | 2.12 | |
| Mimibps=2475, Frame rate=12.5, NVQ=182026.02 | 0.76 | 0.91 | 2.9 | 2.35 | |
| Mimibps=2475, Frame rate=12.5, NVQ=182026.03 | 0.76 | 0.91 | 2.9 | 2.35 | |
| MOSS-Audio-Tokenizerbps=750, Frame rate=12.5, NVQ=62026.02 | 0.75 | 0.89 | 2.73 | 2.22 | |
| Encodecbps=4500, Frame rate=75, NVQ=62026.02 | 0.75 | 0.91 | 2.63 | 2.15 | |
| MOSS-Audio-Tokenizerbps=750, Frame rate=12.5, NVQ=62026.03 | 0.75 | 0.89 | 2.73 | 2.22 | |
| Encodecbps=4500, Frame rate=75, NVQ=62026.03 | 0.75 | 0.91 | 2.63 | 2.15 | |
| XCodec2.0bps=800, Frame rate=50, NVQ=12026.02 | 0.74 | 0.86 | 2.46 | 1.96 | |
| MiMo-Audio-Tokenizerbps=850, Frame rate=25, NVQ=42026.02 | 0.74 | 0.87 | 2.62 | 2.14 | |
| XCodec2.0bps=800, Frame rate=50, NVQ=12026.03 | 0.74 | 0.86 | 2.46 | 1.96 | |
| MiMo-Audio-Tokenizerbps=850, Frame rate=25, NVQ=42026.03 | 0.74 | 0.87 | 2.62 | 2.14 | |
| BigCodecbps=1040, Frame rate=80, NVQ=12026.02 | 0.69 | 0.88 | 2.55 | 2.06 | |
| SpeechTokenizerbps=4000, Frame rate=50, NVQ=82026.02 | 0.69 | 0.85 | 2.2 | 1.87 | |
| BigCodecbps=1040, Frame rate=80, NVQ=12026.03 | 0.69 | 0.88 | 2.55 | 2.06 | |
| SpeechTokenizerbps=4000, Frame rate=50, NVQ=82026.03 | 0.69 | 0.85 | 2.2 | 1.87 | |
| Higgs-Audio-Tokenizerbps=1000, Frame rate=25, NVQ=42026.02 | 0.68 | 0.82 | 2.61 | 2.14 | |
| Higgs-Audio-Tokenizerbps=1000, Frame rate=25, NVQ=42026.03 | 0.68 | 0.82 | 2.61 | 2.14 | |
| DACbps=3000, Frame rate=75, NVQ=42026.02 | 0.67 | 0.88 | 2.47 | 2.07 | |
| DACbps=3000, Frame rate=75, NVQ=42026.03 | 0.67 | 0.88 | 2.47 | 2.07 | |
| Mimibps=1100, Frame rate=12.5, NVQ=82026.02 | 0.59 | 0.85 | 2.24 | 1.78 | |
| Mimibps=1100, Frame rate=12.5, NVQ=82026.03 | 0.59 | 0.85 | 2.24 | 1.78 | |
| SpeechTokenizerbps=2000, Frame rate=50, NVQ=42026.02 | 0.5 | 0.8 | 1.79 | 1.49 | |
| SpeechTokenizerbps=2000, Frame rate=50, NVQ=42026.03 | 0.5 | 0.8 | 1.79 | 1.49 | |
| StableCodecbps=700, Frame rate=25, NVQ=22026.02 | 0.45 | 0.86 | 2.5 | 1.93 | |
| Encodecbps=1500, Frame rate=75, NVQ=22026.02 | 0.45 | 0.81 | 1.8 | 1.48 | |
| StableCodecbps=700, Frame rate=25, NVQ=22026.03 | 0.45 | 0.86 | 2.5 | 1.93 | |
| Encodecbps=1500, Frame rate=75, NVQ=22026.03 | 0.45 | 0.81 | 1.8 | 1.48 | |
| DACbps=1500, Frame rate=75, NVQ=22026.02 | 0.41 | 0.79 | 1.67 | 1.37 | |
| DACbps=1500, Frame rate=75, NVQ=22026.03 | 0.41 | 0.79 | 1.67 | 1.37 | |
| SpeechTokenizerbps=1000, Frame rate=50, NVQ=22026.02 | 0.25 | 0.68 | 1.38 | 1.17 | |
| SpeechTokenizerbps=1000, Frame rate=50, NVQ=22026.03 | 0.25 | 0.68 | 1.38 | 1.17 |