Generalization Reasoning on Aggregate EMMA, VisuLogic, Zebra-CoT
37.5Total ScoreILVR
Evaluation Results
| Method | Links | |
|---|---|---|
| ILVRParadigm=Interleaved, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 2: Latent Relaxation2025.12 | 37.5 | |
| ILVRParadigm=Interleaved, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 1: Latent Alignment2025.12 | 34.8 | |
| MirageParadigm=Single-step, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 2: Latent Relaxation2025.12 | 34.3 | |
| CoT-FTParadigm=Text CoT, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 33.6 | |
| Zero-shotParadigm=Direct Ans., Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 32.8 | |
| Direct-FTParadigm=Direct Ans., Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset2025.12 | 32.3 | |
| PixelReasonerParadigm=Tool-use, Fine-tuning Protocol=Official Checkpoints - No Task-specific Fine-tuning2025.12 | 31.6 | |
| MirageParadigm=Single-step, Fine-tuning Protocol=Fine-tuned on Zebra-CoT 10k subset, Training Stage=Stage 1: Latent Alignment2025.12 | 31.5 | |
| VisionR1Paradigm=Reasoning, Fine-tuning Protocol=Official Checkpoints - No Task-specific Fine-tuning2025.12 | 29.5 |