Visual Question Answering on WTQ (test)
65.4AccuracyGPT-4+OCR
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4+OCRModel Size=~1T, Modality=Text, Evaluation Setting=Zero-Shot (ZS)2023.12 | 65.4 | |
| UReaderModel Size=~7B, Modality=Text+Vision, Evaluation Setting=SDDS2023.12 | 29.4 | |
| DocLLM-7BModel Size=7B, Modality=Text+Layout, Evaluation Setting=SDDS2023.12 | 27.1 | |
| mPLUG-DocOwlModel Size=~7B, Modality=Text+Vision, Evaluation Setting=SDDS2023.12 | 26.9 | |
| Llama2+OCRModel Size=7B, Modality=Text, Evaluation Setting=Zero-Shot (ZS)2023.12 | 25 | |
| DocLLM-1BModel Size=1B, Modality=Text+Layout, Evaluation Setting=SDDS2023.12 | 21.9 |