Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Tang, Yunlong, Bi, Jing, Huang, Chao, Liang, Susan, Shimada, Daiki, Hua, Hang, Xiao, Yunzhong, Song, Yizhi, Liu, Pinxin, Feng, Mingqian, Guo, Junjia, Liu, Zhuo, Song, Luchuan, Vosoughi, Ali, He, Jinxi, He, Liu, Zhang, Zeliang, Luo, Jiebo, Xu, Chenliang
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!