Audio Question Answering
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
80.4Average Score
55
Jun 9, 2026
84.86Counting Accuracy
43
Feb 26, 2026
77.7Score
31
Jun 9, 2026
77.5Score
28
Apr 28, 2026
80.51Accuracy (Avg)
17
Feb 26, 2026
71.02Accuracy
14
Feb 26, 2026
91.4Score
12
Mar 27, 2026
76.8Score
12
Mar 27, 2026
91Score
12
Mar 27, 2026
95.58AlpacaEval AQA Score
12
Mar 27, 2026
48.47Audio-QA Score
12
Mar 26, 2026
44.99Audio QA Score
12
Mar 26, 2026
62.67Audio-QA Score
12
Mar 26, 2026
44.87Audio QA Score
12
Mar 26, 2026
60.77Model-as-Judge Score
12
Feb 26, 2026
52.8Token-Level Accuracy
11
May 20, 2026
96.7Token-Level Accuracy
11
May 20, 2026
60.1Token-Level Accuracy
11
May 20, 2026
74.9Accuracy
11
May 1, 2026
64.21Accuracy (Sub-task 1)
10
Feb 27, 2026
0.974Accuracy (Main Speaker, General)
10
Feb 26, 2026
85.7Accuracy
9
Feb 26, 2026
72.1Accuracy
9
Feb 26, 2026
81.25Accuracy
9
Feb 26, 2026
0.737Accuracy
8
Jun 9, 2026