Dynamic Facial Expression Recognition on FERV39K (test)
43.52UARCLVSR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLVSRBackbone=CLIP-ViT-B/16, Learning Strategy=Vision-language2026.04 | 43.52 | 50.66 | |
| SSMBackbone=CLIP-ViT-B/16, Learning Protocol=Joint learning2026.04 | 43.21 | 53.28 | |
| MAE-DFERBackbone=ViT-B/16, Learning Strategy=Self-supervised2026.04 | 43.12 | 52.07 | |
| OUSBackbone=CLIP-ViT-L/14, Learning Strategy=Vision-language2026.04 | 42.23 | 53.3 | |
| SVFAPBackbone=ViT-B/16, Learning Strategy=Self-supervised2026.04 | 42.14 | 52.29 | |
| A3lign-DFERBackbone=CLIP-ViT-L/14, Learning Strategy=Vision-language2026.04 | 41.87 | 51.77 | |
| PE-CLIPBackbone=CLIP-ViT-B/16, Learning Strategy=Vision-language2026.04 | 41.57 | 51.26 | |
| CLIP-Guided-DFERBackbone=CLIP-ViT-B/32, Learning Strategy=Vision-language2026.04 | 41.43 | 51.83 | |
| DFER-CLIPBackbone=CLIP-ViT-B/32, Learning Strategy=Vision-language2026.04 | 41.27 | 51.65 | |
| DFLMBackbone=CLIP-ViT-B/32, Learning Strategy=Vision-language2026.04 | 41.25 | 51.31 | |
| CLIPERBackbone=CLIP-ViT-B/16, Learning Strategy=Vision-language2026.04 | 41.23 | 51.34 | |
| STLBackbone=CLIP-ViT-B/16, Learning Protocol=Single-task learning2026.04 | 41.1 | 51.71 | |
| IFDD-3DViTBackbone=ViT-B/16, Learning Strategy=Supervised2026.04 | 39.15 | 51.09 | |
| Former-DFERBackbone=Transformer, Learning Strategy=Supervised2026.04 | 37.2 | 46.85 | |
| M3DFELBackbone=ResNet-18-3D, Learning Strategy=Supervised2026.04 | 35.94 | 47.67 | |
| IALBackbone=ResNet-18, Learning Strategy=Supervised2026.04 | 35.82 | 48.54 | |
| NR-DFERNetBackbone=CNN-Transformer, Learning Strategy=Supervised2026.04 | 33.99 | 45.97 | |
| Freq-HDBackbone=VGG13-LSTM, Learning Strategy=Supervised2026.04 | 33.07 | 45.26 | |
| EmoCLIPBackbone=CLIP-ViT-B/32, Learning Strategy=Vision-language2026.04 | 31.41 | 36.18 |