Lifelong Multimodal Instruction Tuning on Dynamic dataset-arrival stream
111.5Relative GainINDUCEKV
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| INDUCEKVSetting=default, Backbone=LLaVA-OV-4B2026.07 | 111.5 | 0.1 | 53.8 | |
| INDUCEKVSetting=matched, Backbone=LLaVA-1.5-7B2026.07 | 110.9 | 0.1 | 53.4 | |
| Adapt-∞Protocol=100k, Backbone=LLaVA-1.5-7B2026.07 | 109.7 | 0.4 | 52.5 | |
| Adapt-∞Protocol=50k, Backbone=LLaVA-1.5-7B2026.07 | 107.2 | 0.2 | 51.7 | |
| Adapt-∞Protocol=25k, Backbone=LLaVA-1.5-7B2026.07 | 102.3 | 0.9 | 50.5 | |
| LITE-Adapt-∞Protocol=25k, Backbone=LLaVA-1.5-7B2026.07 | 99.7 | 1.3 | 49.6 | |
| Random (pruning)Backbone=LLaVA-1.5-7B2026.07 | 95.3 | 2.1 | 47.2 | |
| Multi-taskRole=upper bound, Backbone=LLaVA-1.5-7B2026.07 | 92.5 | — | 46.1 | |
| Random Experience ReplayBackbone=LLaVA-1.5-7B2026.07 | 89.5 | 6.6 | 43.4 | |
| COINCIDEBackbone=LLaVA-1.5-7B2026.07 | 89.5 | 3.9 | 44.7 | |
| SequentialRole=lower bound, Backbone=LLaVA-1.5-7B2026.07 | 68 | 26 | 32 |