FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Fan, Ziyang, Chen, Keyu, Xing, Ruilong, Li, Yulin, Jiang, Li, Tian, Zhuotao
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!