Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Xiong, Yuanhao, Zhao, Long, Gong, Boqing, Yang, Ming-Hsuan, Schroff, Florian, Liu, Ting, Hsieh, Cho-Jui, Yuan, Liangzhe
Natura: Preprint
Pubblicazione: 2023
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi