Image Translation on EN-IT
38.1BLEUVaaWIT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VaaWITTrainable Parameters=50M, LLM Backbone=Qwen3-8B2026.05 | 38.1 | 85.9 | |
| VaaWIT on Qwen3 (8B)Backbone=Qwen3 (8B), Tuning Strategy=DSAM + VAA2026.05 | 38.1 | 85.9 | |
| Full Fine-TuningBackbone=Qwen3-VL (8B), Tuning Strategy=Full Fine-Tuning2026.05 | 36.9 | 72.4 | |
| AnyTransLLM Backbone=Qwen3-8B2026.05 | 35.7 | 80.5 | |
| VaaWIT on LLaMA3.1 (8B)Backbone=LLaMA3.1 (8B), Tuning Strategy=DSAM + VAA2026.05 | 35.2 | 81.6 | |
| Translatotron-VTrainable Parameters=175M, LLM Backbone=Qwen3-8B2026.05 | 34.4 | 77.1 | |
| UMTITTrainable Parameters=293M, LLM Backbone=Qwen3-8B2026.05 | 34.2 | 78.6 | |
| Qwen3-VL (32B)Tuning Strategy=Zero-Shot, Parameters=32B2026.05 | 34.1 | 76.8 | |
| LoRABackbone=Qwen3-VL (8B), Tuning Strategy=LoRA (r=8)2026.05 | 32.9 | 67.7 | |
| Chain-of-ThoughtBackbone=Qwen3-VL (8B), Tuning Strategy=Prompting2026.05 | 32.2 | 70.3 | |
| Gemini2.5 Pro†Tuning Strategy=Zero-Shot2026.05 | 31.5 | 70.3 | |
| PEITTrainable Parameters=71.6M, LLM Backbone=Qwen3-8B2026.05 | 30.9 | 72 | |
| DIMTDATrainable Parameters=242.6M, LLM Backbone=Qwen3-8B2026.05 | 30.5 | 71.8 | |
| GPT4.1†Tuning Strategy=Zero-Shot2026.05 | 30 | 75.2 | |
| PP-OCR_Microsoft APIType=Cascaded Model2026.05 | 27.5 | 71.9 | |
| ItNetTrainable Parameters=60.6M, LLM Backbone=Qwen3-8B2026.05 | 25.1 | 58.9 | |
| EasyOCR_Google APIType=Cascaded Model2026.05 | 25 | 69.2 | |
| Qwen3-VL (8B)Tuning Strategy=Zero-Shot, Parameters=8B2026.05 | 22.7 | 68.8 | |
| E2ETITTrainable Parameters=122M, LLM Backbone=Qwen3-8B2026.05 | 19.6 | 55.8 | |
| LLaMA3.2 (90B)Tuning Strategy=Zero-Shot, Parameters=90B2026.05 | 9.2 | 51.6 | |
| LLaVA-OV (7B)Tuning Strategy=Zero-Shot, Parameters=7B2026.05 | 6.2 | 54.1 | |
| LLaMA3.2 (11B)Tuning Strategy=Zero-Shot, Parameters=11B2026.05 | 2.9 | 48.7 |