Inference Efficiency on 64-frame visual inputs vLLM NVIDIA RTX 4090
0.58First-token Latency (s)MiniCPM-o 4.5
Evaluation Results
| Method | Links | |
|---|---|---|
| MiniCPM-o 4.5Dtype=INT42026.04 | 0.58 | |
| MiniCPM-o 4.5Dtype=BF162026.04 | 0.59 | |
| Qwen3-Omni-30B-A3BDtype=INT42026.04 | 0.98 |