Audio Comprehension on TUT 2017 (test)
0.821AccuracyJavisGPT
Evaluation Results
| Method | Links | |
|---|---|---|
| JavisGPTModel Size=7-8B, #Samples=1.5M, Zero-shot evaluation=true2025.12 | 0.821 | |
| VideoLLaMA2Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 0.784 | |
| Qwen2.5-OmniModel Size=7-8B, Zero-shot evaluation=true2025.12 | 0.783 | |
| VideoLLaMA2.1Model Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 0.773 | |
| Qwen2-AudioModel Size=7-8B, Zero-shot evaluation=true2025.12 | 0.737 | |
| Qwen-AudioModel Size=7-8B, Zero-shot evaluation=true2025.12 | 0.649 | |
| UnifiedIO-2Model Size=7-8B, #Samples=9.2B, Zero-shot evaluation=true2025.12 | 0.091 | |
| NExT-GPTModel Size=7-8B, #Samples=1.9M, Zero-shot evaluation=true2025.12 | 0.064 |