Audio LLM–EEG Similarity Alignment on Naturalistic Speech Dataset OpenNeuro 2023 (sentence-averaged)
0.2446Pearson Correlation (RSA)Audio-Flamingo-3
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Audio-Flamingo-32026.01 | 0.2446 | 0.1397 | 0.0923 | 0.3427 | 0.2234 | 0.0169 | 0.2234 | 0.3015 | |
| GLM-4-Voiceparameters=9B2026.01 | 0.2362 | 0.1773 | 0.1192 | 0.3314 | 0.216 | 0.0151 | 0.216 | 0.2881 | |
| SpeechGPT-2.0-previewparameters=7B2026.01 | 0.2243 | 0.1564 | 0.1102 | 0.3924 | 0.2287 | 0.0171 | 0.2287 | 0.3239 | |
| Granite-Speech-3.3parameters=8B2026.01 | 0.2185 | 0.1617 | 0.1155 | 0.461 | 0.2637 | 0.0185 | 0.2637 | 0.363 | |
| Qwen2-Audioparameters=7B2026.01 | 0.2059 | 0.1615 | 0.108 | 0.3561 | 0.208 | 0.0143 | 0.208 | 0.2863 | |
| Qwen2-Audioparameters=7B, variant=Instruct2026.01 | 0.2053 | 0.1467 | 0.1124 | 0.3649 | 0.2148 | 0.0147 | 0.2148 | 0.2982 | |
| MiniCPM-oversion=2.62026.01 | 0.2045 | 0.1484 | 0.1053 | 0.3563 | 0.2145 | 0.0149 | 0.2145 | 0.2921 | |
| Baichuan-Audiovariant=Instruct2026.01 | 0.1669 | 0.1137 | 0.0774 | 0.5032 | 0.2915 | 0.0208 | 0.2915 | 0.4098 | |
| Llama-3.1-Omniparameters=8B2026.01 | 0.1657 | 0.1217 | 0.0787 | 0.5562 | 0.3401 | 0.0261 | 0.3401 | 0.4595 | |
| Baichuan-Audiovariant=Base2026.01 | 0.1582 | 0.1193 | 0.0902 | 0.461 | 0.2616 | 0.0193 | 0.2616 | 0.3717 | |
| Ultravox-v0.5backbone=LLaMA-3.1-8B2026.01 | 0.148 | 0.0815 | 0.0587 | 0.5696 | 0.3459 | 0.0266 | 0.3459 | 0.4664 | |
| Ultravox-v0.5backbone=LLaMA-3.2-1B2026.01 | 0.1403 | 0.0857 | 0.058 | 0.5682 | 0.3438 | 0.026 | 0.3438 | 0.4633 |