Reasoning on BBH T2T 1,000 items (test)
84.3Overall AccuracyEA-CoT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| EA-CoTModel=Qwen2.5-Omni, Tokens=1,024, Modality=T2T2026.06 | 84.3 | 83.2 | 80.8 | 77.6 | 95.6 | |
| EA-CoTModel=Phi-4-MM, Tokens=1,024, Modality=T2T2026.06 | 77.6 | 77.2 | 82 | 64 | 87.2 | |
| BaselineModel=Qwen2.5-Omni, Tokens=256, Modality=T2T2026.06 | 67 | 72 | 52.8 | 56.4 | 86.8 | |
| BaselineModel=Phi-4-MM, Tokens=256, Modality=T2T2026.06 | 66.7 | 61.6 | 58 | 55.6 | 91.6 |