Multi-modal Visual Question Answering on VQA-T
64.84Accuracy16-bit Baseline
Evaluation Results
| Method | Links | |
|---|---|---|
| 16-bit BaselineData Format=16-bit, Backbone=LLaVA1.6-7B2024.11 | 64.84 | |
| AMXFP4Data Format=AMXFP4, Backbone=LLaVA1.6-7B2024.11 | 59.13 | |
| MXFP4Data Format=MXFP4, Backbone=LLaVA1.6-7B2024.11 | 57.88 | |
| MXFP4-PoTData Format=MXFP4-PoT, Backbone=LLaVA1.6-7B2024.11 | 50.05 |