Violation Identification on ConstructionSite10K 1.0 (test)
98.9Precision (No Violation)GPT 5-shot
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT 5-shotEvaluation Protocol=Few-shot2026.07 | 98.9 | 32 | 48.4 | 18.2 | 89.4 | 30.2 | 39.3 | — | |
| GPTEvaluation Protocol=Zero-shot2026.07 | 97 | 24.6 | 39.2 | 20.4 | 76.4 | 32.2 | 35.7 | — | |
| Human upper bound2026.07 | 95.3 | 98.3 | 96.8 | 95.6 | 66.6 | 78.5 | 88 | — | |
| Qwen2.5*Evaluation Protocol=LoRA-tuning, Model Size=7B2026.07 | 94.3 | 92.4 | 93.3 | 44.5 | 52.1 | 48 | 70.7 | 193 | |
| AVA-VLM (7B)Evaluation Protocol=LoRA-tuning, Model Size=7B, Resolution=1/4 downsampled global images2026.07 | 93.8 | 97.6 | 95.7 | 68.5 | 45.2 | 54.5 | 75.1 | 30.6 | |
| Qwen2.5 (Baseline) (7B)Evaluation Protocol=LoRA-tuning, Model Size=7B2026.07 | 91.1 | 99.9 | 95.3 | 94.4 | 16.8 | 28.6 | 62 | 100 | |
| LLaVA-v1.5 (13B) CoTEvaluation Protocol=Zero-shot, Model Size=13B, Reasoning Strategy=CoT2026.07 | 91 | 44 | 59.3 | 12 | 55 | 19.7 | 39.5 | — | |
| Qwen2.5 (7B)Evaluation Protocol=Zero-shot, Model Size=7B2026.07 | 89.5 | 100 | 94.5 | 0 | 0 | 0 | 47.3 | 100 | |
| LLaVA-v1.5 (13B)Evaluation Protocol=Zero-shot, Model Size=13B2026.07 | 88 | 43.4 | 58.1 | 12 | 54 | 19.6 | 38.9 | — | |
| LLaVA-NeXT (34B) 1-shotEvaluation Protocol=Few-shot, Model Size=34B2026.07 | 87.1 | 88.7 | 87.9 | 14.3 | 13 | 13.6 | 50.8 | — |