Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Tang, Yunlong, Bi, Jing, Huang, Chao, Liang, Susan, Shimada, Daiki, Hua, Hang, Xiao, Yunzhong, Song, Yizhi, Liu, Pinxin, Feng, Mingqian, Guo, Junjia, Liu, Zhuo, Song, Luchuan, Vosoughi, Ali, He, Jinxi, He, Liu, Zhang, Zeliang, Luo, Jiebo, Xu, Chenliang
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!