Scene Classification on NWPU
96.92Top-1 AccEarthDial
Evaluation Results
| Method | Links | |
|---|---|---|
| EarthDialLLM=Phi-3-mini2025.12 | 96.92 | |
| LWGANet L2Backbone Type=Hybrid, Params. (M)=13.0, FLOPs (G)=1.87, GPU Speed (FPS)=3308, CPU Speed (FPS)=16.18, ARM Speed (FPS)=274.3, Training image size=224x2242025.01 | 96.17 | |
| LWGANet L1Backbone Type=Hybrid, Params. (M)=5.90, FLOPs (G)=0.709, GPU Speed (FPS)=6418, CPU Speed (FPS)=34.08, ARM Speed (FPS)=375.8, Training image size=224x2242025.01 | 95.7 | |
| LWGANet L0Backbone Type=Hybrid, Params. (M)=1.72, FLOPs (G)=0.186, GPU Speed (FPS)=13234, CPU Speed (FPS)=80.00, ARM Speed (FPS)=687.8, Training image size=224x2242025.01 | 95.49 | |
| MobileNet V2 2.0×Backbone Type=CNN, Params. (M)=8.81, FLOPs (G)=1.17, GPU Speed (FPS)=5567, CPU Speed (FPS)=17.03, ARM Speed (FPS)=372.3, Training image size=224x2242025.01 | 95.35 | |
| MobileViT SBackbone Type=Hybrid, Params. (M)=5.03, FLOPs (G)=1.75, GPU Speed (FPS)=2681, CPU Speed (FPS)=10.20, ARM Speed (FPS)=152.7, Training image size=256x2562025.01 | 95.19 | |
| Efficientformer V2 S2Backbone Type=Transformer, Params. (M)=12.3, FLOPs (G)=1.26, GPU Speed (FPS)=642, CPU Speed (FPS)=24.74, ARM Speed (FPS)=123.8, Training image size=224x2242025.01 | 95.14 | |
| FasterNet T2Backbone Type=CNN, Params. (M)=13.8, FLOPs (G)=1.91, GPU Speed (FPS)=6852, CPU Speed (FPS)=26.40, ARM Speed (FPS)=669.8, Training image size=224x2242025.01 | 95.11 | |
| MobileNet V2 1.0×Backbone Type=CNN, Params. (M)=2.28, FLOPs (G)=0.319, GPU Speed (FPS)=11301, CPU Speed (FPS)=49.11, ARM Speed (FPS)=785.4, Training image size=224x2242025.01 | 95.06 | |
| Efficientformer V2 S1Backbone Type=Transformer, Params. (M)=5.87, FLOPs (G)=0.661, GPU Speed (FPS)=1211, CPU Speed (FPS)=36.96, ARM Speed (FPS)=204.5, Training image size=224x2242025.01 | 94.97 | |
| MobileViT XSBackbone Type=Hybrid, Params. (M)=2.02, FLOPs (G)=0.900, GPU Speed (FPS)=3300, CPU Speed (FPS)=12.99, ARM Speed (FPS)=306.3, Training image size=256x2562025.01 | 94.9 | |
| EdgeViT XXSBackbone Type=Transformer, Params. (M)=3.79, FLOPs (G)=0.546, GPU Speed (FPS)=4153, CPU Speed (FPS)=46.36, ARM Speed (FPS)=259.9, Training image size=224x2242025.01 | 94.75 | |
| PVT V2 B1Backbone Type=Transformer, Params. (M)=13.5, FLOPs (G)=2.04, GPU Speed (FPS)=2369, CPU Speed (FPS)=15.96, ARM Speed (FPS)=145.3, Training image size=224x2242025.01 | 94.62 | |
| VHMLLM=Vicuna-1.5-7B2025.12 | 94.54 | |
| Efficientformer V2 S0Backbone Type=Transformer, Params. (M)=3.36, FLOPs (G)=0.396, GPU Speed (FPS)=1299, CPU Speed (FPS)=54.00, ARM Speed (FPS)=272.0, Training image size=224x2242025.01 | 94.52 | |
| MobileViT XXSBackbone Type=Hybrid, Params. (M)=1.03, FLOPs (G)=0.333, GPU Speed (FPS)=4811, CPU Speed (FPS)=31.87, ARM Speed (FPS)=453.6, Training image size=256x2562025.01 | 94.37 | |
| PVT V2 B0Backbone Type=Transformer, Params. (M)=3.42, FLOPs (G)=0.533, GPU Speed (FPS)=3843, CPU Speed (FPS)=40.26, ARM Speed (FPS)=243.4, Training image size=224x2242025.01 | 94.35 | |
| MF-RSVLMLLM=Vicuna-1.5-7B2025.12 | 94.29 | |
| FasterNet T1Backbone Type=CNN, Params. (M)=6.37, FLOPs (G)=0.855, GPU Speed (FPS)=11876, CPU Speed (FPS)=51.42, ARM Speed (FPS)=650.1, Training image size=224x2242025.01 | 93.73 | |
| FasterNet T0Backbone Type=CNN, Params. (M)=2.68, FLOPs (G)=0.338, GPU Speed (FPS)=18276, CPU Speed (FPS)=106.4, ARM Speed (FPS)=839.7, Training image size=224x2242025.01 | 93.3 | |
| InternVL3.5LLM=InternVL3.52025.12 | 92.35 | |
| GeoChatLLM=Vicuna-1.5-7B2025.12 | 89.24 | |
| LHRS-BotLLM=LLaMA-2-7B2025.12 | 83.94 | |
| Qwen2.5-VLLLM=Qwen2.5-7B2025.12 | 64.35 | |
| MiniCPM-V-2.6LLM=Qwen2-7B2025.12 | 62.13 | |
| InternVL2.5LLM=InternLM-2.52025.12 | 57.94 | |
| Phi-3.5-VisionLLM=Phi-3.52025.12 | 48.03 | |
| InternLM-XComposeLLM=InternLM-7B2025.12 | 47.51 | |
| mPLUG-OWL2LLM=LLaMA-2-7B2025.12 | 46.58 | |
| Qwen-VLLLM=Qwen-7B2025.12 | 42.73 | |
| Domain-Aware Reinforcement Fine-TuningBase Model=QwenVL, Fine-tuning Strategy=Reinforcement Fine-Tuning2026.01 | 36.4 | |
| LLaVA-1.5LLM=Vicuna-1.5-7B2025.12 | 34.96 | |
| InstructBLIPLLM=Vicuna-7B2025.12 | 34.01 | |
| MiniGPTv2LLM=LLaMA-2-7B2025.12 | 28.15 | |
| QwenVLBase Model=QwenVL2026.01 | 14.9 | |
| QwenVL + Domain PromptBase Model=QwenVL, Injection Strategy=Domain Prompt2026.01 | 14.9 | |
| QwenVL + Caption(BLIP)Base Model=QwenVL, Injection Strategy=Caption (BLIP)2026.01 | 14.7 | |
| QwenVL + Caption(MLLM)Base Model=QwenVL, Injection Strategy=Caption (MLLM)2026.01 | 10.5 |