Table-to-LaTeX generation on TableTex (test)
89.7TEDSQwen2.5-VL-7B-GRPO
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B-GRPOModel=Qwen2.5-VL-7B-GRPO, Parameter Scale=7B, Reward Design=Global Reward2026.04 | 89.7 | 50.6 | 80.7 | 89.7 | 58.9 | 76.8 | 80.5 | 93.7 | 99.9 | |
| Qwen2.5-VL-7B-CSPOModel=Qwen2.5-VL-7B-CSPO (Ours), Parameter Scale=7B, Strategy=CSPO2026.04 | 89.7 | 53 | 81.4 | 90 | 60.6 | 76.6 | 82.7 | 93.9 | 99.8 | |
| Qwen2.5-VL-7B-VSGRPO*Model=Qwen2.5-VL-7B-VSGRPO*, Parameter Scale=7B, Reward Design=VSGRPO2026.04 | 89.5 | 51.1 | 81.3 | 89.9 | 58.2 | 76.8 | 79.5 | 93.9 | 99.9 | |
| Qwen2.5-VL-3B-CSPOModel=Qwen2.5-VL-3B-CSPO (Ours), Parameter Scale=3B, Strategy=CSPO2026.04 | 87.9 | 45.2 | 77.6 | 87 | 53.6 | 76.5 | 74.2 | 92.1 | 99.6 | |
| Qwen2.5-VL-3B-VSGRPO*Model=Qwen2.5-VL-3B-VSGRPO*, Parameter Scale=3B, Reward Design=VSGRPO2026.04 | 87.8 | 40.4 | 77.5 | 86.6 | 47.6 | 70.9 | 71.4 | 91.9 | 99.7 | |
| Qwen2.5-VL-3B-GRPOModel=Qwen2.5-VL-3B-GRPO, Parameter Scale=3B, Reward Design=Global Reward2026.04 | 87.7 | 42 | 74.7 | 86.7 | 50.3 | 74.9 | 71.5 | 92 | 99.6 | |
| Qwen2.5-VL-72BModel=Qwen2.5-VL-72B, Parameter Scale=72B2026.04 | 75.9 | 10.1 | 79.6 | 76.2 | 12.6 | 32.1 | 56.7 | 69.9 | 99.7 | |
| GPT-4oModel=GPT-4o2026.04 | 72.3 | 6.8 | 65 | 73.1 | 9.4 | 23 | 54 | 72.5 | 99.9 | |
| NougatModel=Nougat2026.04 | 67.9 | 21.2 | 68.7 | 63.3 | 25.8 | 37.1 | 71.9 | 70.1 | 99.1 | |
| Gemini-2.5 FlashModel=Gemini-2.5 Flash2026.04 | 66.2 | 11.1 | 78.8 | 79.2 | 12.9 | 33.5 | 47.2 | 81.3 | 99.3 | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL-3B, Parameter Scale=3B2026.04 | 66 | 3.1 | 51.8 | 59.8 | 4.5 | 18.9 | 34 | 61.7 | 93.7 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B, Parameter Scale=7B2026.04 | 64 | 5.3 | 67 | 63 | 6.4 | 19.5 | 46.7 | 60.7 | 77.2 |