Text-to-Audio Generation on Grand Challenge (test)
75.7FADFluxAudio-S (Organizer’s Baseline)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FluxAudio-S (Organizer’s Baseline)params=120M, Train Data(hours)=3.7K2026.07 | 75.7 | 8.8 | 59.2 | |
| MeanAudio-L-Fullparams=480M, Train Data(hours)=10K2026.07 | 66 | 20.2 | 78.3 | |
| MeanAudio-S-Fullparams=120M, Train Data(hours)=10K2026.07 | 64.9 | 21 | 80.8 | |
| proposed (Text-500)params=480M, Train Data(hours)=3.7K2026.07 | 64.6 | 26 | 76.7 | |
| Stable Audio Openparams=1.1B, Train Data(hours)=7.3K2026.07 | 57.4 | 32.1 | 80 | |
| MusicGen-smallparams=300M, Train Data(hours)=20K2026.07 | 57.4 | 37 | 87.5 | |
| MusicGen-largeparams=3.3B, Train Data(hours)=20K2026.07 | 55.3 | 37.9 | 88.8 | |
| MusicGen-mediumparams=1.5B, Train Data(hours)=20K2026.07 | 54.8 | 35.3 | 89.2 |