VLM Reasoning on NumberLine Out-of-Distribution
18.6Success RateGFlowVLM w/ DB
Evaluation Results
| Method | Links | |
|---|---|---|
| GFlowVLM w/ DBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 18.6 | |
| GFlowVLM w/ Var-TBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 17.3 | |
| GFlowVLM w/ SubTBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 16.7 | |
| GFlowVLM w/ DBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 9.1 | |
| GFlowVLM w/ SubTBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 7 | |
| GFlowVLM w/ Var-TBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 6.2 | |
| RL4VLM+Train Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 4.4 | |
| RL4VLMTrain Data=On-Policy, Assump.=Markovian, SFT Init.=Yes2025.03 | 3.1 | |
| RL4VLM*Train Data=On-Policy, Assump.=Markovian, SFT Init.=Yes, Reward function=Same as ours2025.03 | 1.9 | |
| SFT-w/o- [DONE]Train Data=Off-Policy, Assump.=N/A, SFT Init.=N/A2025.03 | 0 | |
| SFT-w/- [DONE]Train Data=Off-Policy, Assump.=N/A, SFT Init.=N/A2025.03 | 0 | |
| GFlowVLM w/ SubTBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 0 | |
| GFlowVLM w/ DBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 0 | |
| GFlowVLM w/ SubTBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 0 | |
| GFlowVLM w/ DBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 0 |