Sound Event Detection on AudioSet Strongly-labeled (test)
0.374PSDS1 (w/o var-pen)ATST-C2F
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ATST-C2FEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.374 | 0.125 | 0.572 | 0.266 | — | |
| ATST-FrameEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.347 | 0.069 | 0.538 | 0.152 | — | |
| ATST-ClipEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.328 | 0.083 | 0.478 | 0.178 | — | |
| ATST-F2CEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.323 | 0.075 | 0.47 | 0.163 | — | |
| M2DEvaluation Protocol=Finetuning, Learning rate=0.12023.06 | 0.292 | 0.042 | 0.509 | 0.199 | — | |
| BEATS_iter3Evaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.29 | 0.045 | 0.491 | 0.186 | — | |
| Audio-MAE (local)Evaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.276 | 0.038 | 0.476 | 0.182 | — | |
| MAE-AST-PATCHEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.274 | 0.039 | 0.481 | 0.187 | — | |
| SSAST-PATCHEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.243 | 0.017 | 0.411 | 0.122 | — | |
| ATST-FrameEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.207 | 0.008 | 0.304 | 0.048 | — | |
| M2DEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.182 | 0 | 0.301 | 0.039 | — | |
| ATST-ClipEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.12 | 0 | 0.201 | 0.001 | — | |
| MAE-AST-PATCHEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.116 | 0 | 0.185 | 0 | — | |
| BYOL-A-V2-40msEvaluation Protocol=Finetuning, Learning rate=0.52023.06 | 0.11 | 0 | 0.243 | 0.027 | — | |
| BYOL-A-V2-40msEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.087 | 0 | 0.083 | 0 | — | |
| Audio-MAE (local)Evaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.073 | 0 | 0.107 | 0 | — | |
| SSAST-PATCHEvaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.048 | 0 | 0.067 | 0 | — | |
| BEATS_iter3Evaluation Protocol=Linear Evaluation, Learning rate=0.52023.06 | 0.034 | 0 | 0.062 | 0 | — | |
| Audio Flamingo 3 (raw predictions)Backbone=Audio Flamingo 3, Scoring=raw predictions2026.07 | — | — | — | — | 0.2 | |
| BEATsTraining=supervised2026.07 | — | — | — | — | 0.33 | |
| FineLAP2026.04 | — | — | — | — | 0.474 | |
| FLAM2026.04 | — | — | — | — | 0.351 | |
| FlexSED2026.04 | — | — | — | — | 0.448 | |
| HTSAT-BERT2026.04 | — | — | — | — | 0.284 | |
| MGA-CLAP2026.04 | — | — | — | — | 0.354 | |
| NMS-MTLABackbone=Audio Flamingo 3, Scoring=NMS-MTLA (ours)2026.07 | — | — | — | — | 0.26 | |
| NMS-SVARBackbone=Audio Flamingo 3, Scoring=NMS-SVAR2026.07 | — | — | — | — | 0.23 | |
| PEA-Frame2026.04 | — | — | — | — | 0.431 | |
| PT-SED2026.04 | — | — | — | — | 0.465 |