Audio Question Answering on AudioCaps (test)
60.1Token-Level AccuracyIndividual
Evaluation Results
| Method | Links | |
|---|---|---|
| IndividualTraining Strategy=Full-Data Training, T.E.=~7d2026.05 | 60.1 | |
| GST-T2Training Strategy=Full-Data Training, T.E.=~2d2026.05 | 58.8 | |
| GST-G3Training Strategy=Full-Data Training, T.E.=~2d2026.05 | 56.7 | |
| Mix AllTraining Strategy=Full-Data Training, T.E.=~4d2026.05 | 56.1 | |
| GST-G2Training Strategy=Full-Data Training, T.E.=~2d2026.05 | 55.4 | |
| Mix AllTraining Strategy=Low-Resource Finetuning, T.E.=~0.5d2026.05 | 52.1 | |
| GST-T2Training Strategy=Low-Resource Finetuning, T.E.=~0.5d2026.05 | 50.9 | |
| SALMONNTraining Strategy=Full-Data Training, T.E.=N/A2026.05 | 50.7 | |
| GST-G2Training Strategy=Low-Resource Finetuning, T.E.=~0.5d2026.05 | 50.4 | |
| GST-G3Training Strategy=Low-Resource Finetuning, T.E.=~1d2026.05 | 48.2 | |
| SequentialTraining Strategy=Full-Data Training, T.E.=~7d2026.05 | 42.7 |