Multimodal Reasoning on EMMA BENCH
31Chemistry ScoreILVR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ILVRParadigm=Interleaved, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 2: Latent Relaxation2025.12 | 31 | 33.3 | 35 | 34 | 33 | |
| Bagel-ZebraParadigm=Unified, Fine-tuning Protocol=Official Checkpoints - No Task-specific Fine-tuning2025.12 | 23 | 28 | 28 | 29 | 32 | |
| ILVRParadigm=Interleaved, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 1: Latent Alignment2025.12 | 23 | 29.5 | 26 | 34 | 35 | |
| CoT-FTParadigm=Text CoT, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 21 | 27.8 | 26 | 33 | 31 | |
| PixelReasonerParadigm=Tool-use, Fine-tuning Protocol=Official Checkpoints - No Task-specific Fine-tuning2025.12 | 19 | 23.5 | 22 | 26 | 27 | |
| Zero-shotParadigm=Direct Ans., Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 18 | 26 | 25 | 28 | 33 | |
| Direct-FTParadigm=Direct Ans., Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 16 | 25.8 | 27 | 28 | 32 | |
| VisionR1Paradigm=Reasoning, Fine-tuning Protocol=Official Checkpoints - No Task-specific Fine-tuning2025.12 | 15 | 24.3 | 30 | 32 | 20 | |
| MirageParadigm=Single-step, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 2: Latent Relaxation2025.12 | 15 | 27 | 25 | 35 | 33 | |
| MirageParadigm=Single-step, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 1: Latent Alignment2025.12 | 13 | 25.3 | 21 | 30 | 37 |