Task recognition on COIN
94.5AccuracyGAD
Evaluation Results
| Method | Links | |
|---|---|---|
| GADBackbone=Llama3-8B-Instruct, Classifier Type=Generative-Assisted Discriminative2026.03 | 94.5 | |
| DiscBackbone=Llama3-8B-Instruct, Classifier Type=Discriminative2026.03 | 94.3 | |
| GADBackbone=Llama3.2-1B-Instruct, Classifier Type=Generative-Assisted Discriminative2026.03 | 93.5 | |
| StreamMind-8BBackbone=8B2026.03 | 93.2 | |
| Videollm-MoD-8BBackbone=8B2026.03 | 92.8 | |
| DiscBackbone=Llama3.2-1B-Instruct, Classifier Type=Discriminative2026.03 | 92.8 | |
| Videollm-online-8BBackbone=8B2026.03 | 92.7 | |
| OursDownstream architecture=Transformer2023.07 | 90.5 | |
| VideoTaskGraph2026.03 | 90.5 | |
| DistantSup.Downstream architecture=Transformer2023.07 | 90 | |
| OursDownstream architecture=MLP2023.07 | 89.4 | |
| TimeSformerDownstream architecture=Transformer2023.07 | 88.9 | |
| DistantSup.Downstream architecture=MLP2023.07 | 88.2 | |
| TimeSformerDownstream architecture=MLP2023.07 | 87 | |
| VideoCLIPDownstream architecture=MLP2023.07 | 82.9 | |
| TSNDownstream architecture=Transformer2023.07 | 73.4 | |
| VideoCLIPDownstream architecture=Transformer2023.07 | 72.5 | |
| SlowFastDownstream architecture=MLP2023.07 | 72.4 | |
| SlowFastDownstream architecture=Transformer2023.07 | 71.6 | |
| S3DDownstream architecture=Transformer2023.07 | 70.2 | |
| S3DDownstream architecture=MLP2023.07 | 68.5 | |
| ClipBERTDownstream architecture=Transformer2023.07 | 65.4 |