Text-to-Audio Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0KL Divergence
213
Jul 7, 2026
17.23FID
17
Feb 26, 2026
1.44Fréchet Audio Distance (FAD)
14
Jun 12, 2026
1.85FAD
11
Mar 25, 2026
1.17KL Divergence
10
Jun 4, 2026
3.539CE Score
10
Mar 13, 2026
108.69FDopenl3
10
Feb 26, 2026
2.47FAD
9
Jun 16, 2026
75.7FAD
8
Jul 3, 2026
6.42PQ
8
Mar 25, 2026
0.73FAD
8
Mar 25, 2026
0.46FAD
8
Mar 25, 2026
25.97FD
8
Mar 10, 2026
246.9FD
6
Apr 3, 2026
42.71CLAP Score
6
Feb 26, 2026
1.41FAD
6
Feb 26, 2026
0.526CLAP Score
6
Feb 26, 2026
49CLAP Score
5
Jun 4, 2026
2.18KL Divergence
4
Feb 26, 2026
19.96EOS
4
Feb 26, 2026
0.249Z-Score (OVL)
4
Feb 26, 2026
92.1Structure: Intro
4
Feb 26, 2026
24.26FD
4
Feb 26, 2026
23.18FD
3
Jul 1, 2026
2.36KL Divergence
3
Feb 26, 2026