VLM Reasoning on NumberLine (In-Distribution)
100Success RateGFlowVLM w/ Var-TB
Evaluation Results
| Method | Links | |
|---|---|---|
| GFlowVLM w/ Var-TBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| GFlowVLM w/ SubTBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| GFlowVLM w/ DBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| GFlowVLM w/ Var-TBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| GFlowVLM w/ SubTBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| GFlowVLM w/ DBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 100 | |
| RL4VLM+Train Data=On-Policy, Assump.=Non-Markovian, SFT Init.=Yes2025.03 | 90.3 | |
| RL4VLMTrain Data=On-Policy, Assump.=Markovian, SFT Init.=Yes2025.03 | 89.4 | |
| RL4VLM*Train Data=On-Policy, Assump.=Markovian, SFT Init.=Yes, Reward function=Same as ours2025.03 | 34.8 | |
| GFlowVLM w/ SubTBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 34.4 | |
| GFlowVLM w/ DBTrain Data=Off-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 33.1 | |
| SFT-w/o- [DONE]Train Data=Off-Policy, Assump.=N/A, SFT Init.=N/A2025.03 | 24.8 | |
| GFlowVLM w/ DBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 24.3 | |
| SFT-w/- [DONE]Train Data=Off-Policy, Assump.=N/A, SFT Init.=N/A2025.03 | 24 | |
| GFlowVLM w/ SubTBTrain Data=On-Policy, Assump.=Non-Markovian, SFT Init.=No2025.03 | 23 |