Brain Captioning on Natural Scenes Dataset (NSD) (test)
66.38BLEU-1BrainROI
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BrainROITraining setting=cross-subject2025.12 | 66.38 | 50.77 | 38.63 | 29.11 | — | — | 69.52 | — | 59.62 | 48.9 | 80.69 | |
| Neuro-Vision to Languagenumber_of_models=1, ground_truth_source=BLIP2-generated captions, ViT3D=true2024.04 | 64.26 | 51.44 | 47.7 | 32.17 | 20.41 | 52.61 | 83.94 | 18.27 | 68.72 | — | — | |
| BrainROI-S1Training setting=single-subject2025.12 | 63.1 | 46.09 | 33.51 | 24.31 | — | — | 59.83 | — | 59.52 | 45.68 | 80.27 | |
| MINDLLMTraining setting=cross-subject2025.12 | 61.75 | 42.84 | 29.86 | 21.24 | — | — | 60.97 | — | — | 45.82 | — | |
| VINDEXTraining setting=cross-subject2025.12 | 60 | 40.72 | 27.57 | 18.91 | — | — | 60.32 | — | 68.26 | 43.78 | 73.88 | |
| UMBRAETraining setting=cross-subject2025.12 | 59.44 | 40.48 | 27.66 | 19.03 | — | — | 61.06 | — | 67.78 | 43.71 | 73.54 | |
| Neuro-Vision to Languagenumber_of_models=1, ground_truth_source=BLIP2-generated captions, ViT3D=false2024.04 | 58.87 | 42.11 | 29.48 | 21.39 | 15.85 | 38.48 | 56.37 | 11.27 | 64.35 | — | — | |
| VINDEX-S1Training setting=single-subject2025.12 | 57.99 | 39 | 26.04 | 17.83 | — | — | 53.96 | — | 66.94 | 42.27 | 72.64 | |
| UMBRAEnumber_of_models=1, ground_truth_source=Standard2024.04 | 57.84 | 38.43 | 25.41 | 17.17 | 18.7 | 42.14 | 53.87 | 12.27 | 66.1 | — | — | |
| UMBRAE-S1Training setting=single-subject2025.12 | 57.63 | 38.02 | 25 | 16.76 | — | — | 51.93 | — | 66.44 | 42.15 | 72.12 | |
| Neuro-Vision to Languagenumber_of_models=1, ground_truth_source=Standard, ViT3D=true2024.04 | 57.19 | 37.17 | 23.78 | 15.85 | 18.6 | 36.67 | 49.51 | 12.39 | 65.49 | — | — | |
| BrainCapnumber_of_models=4, ground_truth_source=Standard2024.04 | 55.96 | 36.21 | 22.7 | 14.51 | 16.68 | 40.69 | 41.3 | 9.06 | 64.31 | — | — | |
| BrainCap-S1Training setting=single-subject2025.12 | 55.96 | 36.21 | 22.7 | 14.51 | — | — | 41.3 | — | 64.31 | 40.69 | 69.9 | |
| MindEye2Training setting=cross-subject2025.12 | 54.82 | 38.6 | 26.49 | 18.16 | — | — | 55.7 | — | 67.54 | 43.77 | 73.73 | |
| Neuro-Vision to Languagenumber_of_models=1, ground_truth_source=Standard, ViT3D=false2024.04 | 52.91 | 32.18 | 15.64 | 8.49 | 14.07 | 23.25 | 39.64 | 8.34 | 56.92 | — | — | |
| OneLLMnumber_of_models=4, ground_truth_source=Standard2024.04 | 47.04 | 26.97 | 15.49 | 9.51 | 13.55 | 35.05 | 22.99 | 6.26 | 54.8 | — | — | |
| OneLLM-S1Training setting=single-subject2025.12 | 47.04 | 26.97 | 15.49 | 9.51 | — | — | 22.99 | — | 54.8 | 35.05 | 61.28 | |
| SDReconnumber_of_models=4, ground_truth_source=Standard2024.04 | 36.21 | 17.11 | 7.72 | 3.43 | 10.03 | 25.13 | 13.83 | 5.02 | 61.07 | — | — | |
| SDRecon-S1Training setting=single-subject2025.12 | 36.21 | 17.11 | 7.72 | 3.43 | — | — | 13.83 | — | 61.07 | 25.13 | 66.36 | |
| UniBrainnumber_of_models=4, ground_truth_source=Standard2024.04 | — | — | — | — | 16.9 | 22.2 | — | — | — | — | — |