Multimodal Image Understanding on MMMU
54.2ScoreBAGEL-Uni-Edit (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| BAGEL-Uni-Edit (Ours)Training Stage=Stage 22026.05 | 54.2 | |
| MRoPE-IBackbone=Qwen3-VL-8B-Instruct2025.10 | 53.89 | |
| BAGEL-Uni-Edit (Ours)Training Stage=Stage 12026.05 | 53.6 | |
| MHRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 53.33 | |
| Uni-Edit w/o VAE dropoutVAE dropout=false2026.05 | 52.9 | |
| BAGEL2026.05 | 52.8 | |
| BAGEL-RecA2026.05 | 52.8 | |
| Uni-Edit w/o joint trainingjoint training=false2026.05 | 52.8 | |
| Uni-Edit ViT (und.) 224x224Resolution=224x2242026.05 | 52.5 | |
| BAGEL-AnyEdit2026.05 | 52.2 | |
| HoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 51.89 | |
| VideoRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 51.78 | |
| Uni-Edit ViT (und.) 224x980Resolution=224x9802026.05 | 51.7 | |
| Vanilla RoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 51.18 | |
| Uni-Edit ViT (und.) 378x980Resolution=378x9802026.05 | 51.1 | |
| CircleRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 50.67 | |
| MRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 50.11 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 46.33 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 46.11 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 45.78 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 45.44 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 45.33 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 44.44 | |
| +Uni-Edit (Ours)Base Model=Janus-Pro2026.05 | 43.5 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 42.89 | |
| Janus-Pro2026.05 | 41.5 |