Streaming Dense Video Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Xingyi, Arnab, Anurag, Buch, Shyamal, Yan, Shen, Myers, Austin, Xiong, Xuehan, Nagrani, Arsha, Schmid, Cordelia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dense Video Object Captioning from Disjoint Supervision
par: Zhou, Xingyi, et autres
Publié: (2023)
par: Zhou, Xingyi, et autres
Publié: (2023)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025)
par: Wysoczańska, Monika, et autres
Publié: (2025)
VoCap: Video Object Captioning and Segmentation from Any Prompt
par: Uijlings, Jasper, et autres
Publié: (2025)
par: Uijlings, Jasper, et autres
Publié: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
par: Min, Juhong, et autres
Publié: (2024)
par: Min, Juhong, et autres
Publié: (2024)
VicTR: Video-conditioned Text Representations for Activity Recognition
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
par: Nagrani, Arsha, et autres
Publié: (2026)
par: Nagrani, Arsha, et autres
Publié: (2026)
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
par: Jain, Gagan, et autres
Publié: (2024)
par: Jain, Gagan, et autres
Publié: (2024)
CAViAR: Critic-Augmented Video Agentic Reasoning
par: Menon, Sachit, et autres
Publié: (2025)
par: Menon, Sachit, et autres
Publié: (2025)
MINERVA: Evaluating Complex Video Reasoning
par: Nagrani, Arsha, et autres
Publié: (2025)
par: Nagrani, Arsha, et autres
Publié: (2025)
Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2024)
par: Kazakos, Evangelos, et autres
Publié: (2024)
Video Summarization: Towards Entity-Aware Captions
par: Ayyubi, Hammad A., et autres
Publié: (2023)
par: Ayyubi, Hammad A., et autres
Publié: (2023)
Neptune: The Long Orbit to Benchmarking Long Video Understanding
par: Nagrani, Arsha, et autres
Publié: (2024)
par: Nagrani, Arsha, et autres
Publié: (2024)
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
par: Singh, Darshan, et autres
Publié: (2026)
par: Singh, Darshan, et autres
Publié: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
What Are You Doing? A Closer Look at Controllable Human Video Generation
par: Bugliarello, Emanuele, et autres
Publié: (2025)
par: Bugliarello, Emanuele, et autres
Publié: (2025)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
par: Shvetsova, Nina, et autres
Publié: (2025)
par: Shvetsova, Nina, et autres
Publié: (2025)
Time-, Memory- and Parameter-Efficient Visual Adaptation
par: Mercea, Otniel-Bogdan, et autres
Publié: (2024)
par: Mercea, Otniel-Bogdan, et autres
Publié: (2024)
Dense Optical Tracking: Connecting the Dots
par: Moing, Guillaume Le, et autres
Publié: (2023)
par: Moing, Guillaume Le, et autres
Publié: (2023)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
par: Fiastre, Gabriel, et autres
Publié: (2025)
par: Fiastre, Gabriel, et autres
Publié: (2025)
Streaming Detection of Queried Event Start
par: Eyzaguirre, Cristobal, et autres
Publié: (2024)
par: Eyzaguirre, Cristobal, et autres
Publié: (2024)
Technical Report for Soccernet 2023 -- Dense Video Captioning
par: Ruan, Zheng, et autres
Publié: (2024)
par: Ruan, Zheng, et autres
Publié: (2024)
Audiovisual Masked Autoencoders
par: Georgescu, Mariana-Iuliana, et autres
Publié: (2022)
par: Georgescu, Mariana-Iuliana, et autres
Publié: (2022)
AutoAD III: The Prequel -- Back to the Pixels
par: Han, Tengda, et autres
Publié: (2024)
par: Han, Tengda, et autres
Publié: (2024)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
par: Mkhallati, Hassan, et autres
Publié: (2023)
par: Mkhallati, Hassan, et autres
Publié: (2023)
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
par: Ventura, Lucas, et autres
Publié: (2025)
par: Ventura, Lucas, et autres
Publié: (2025)
CoVR-2: Automatic Data Construction for Composed Video Retrieval
par: Ventura, Lucas, et autres
Publié: (2023)
par: Ventura, Lucas, et autres
Publié: (2023)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
par: Li, Yizhe, et autres
Publié: (2025)
par: Li, Yizhe, et autres
Publié: (2025)
BrickNet: Graph-Backed Generative Brick Assembly
par: Kulits, Peter, et autres
Publié: (2026)
par: Kulits, Peter, et autres
Publié: (2026)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
par: Jeon, MinJu, et autres
Publié: (2025)
par: Jeon, MinJu, et autres
Publié: (2025)
Dense Video Captioning Using Unsupervised Semantic Information
par: Estevam, Valter, et autres
Publié: (2021)
par: Estevam, Valter, et autres
Publié: (2021)
Visual Lexicon: Rich Image Features in Language Space
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning
par: Xie, Zhuyang, et autres
Publié: (2024)
par: Xie, Zhuyang, et autres
Publié: (2024)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
Continual Learning in Vision-Language Models via Aligned Model Merging
par: Sokar, Ghada, et autres
Publié: (2025)
par: Sokar, Ghada, et autres
Publié: (2025)
Time-Scaling State-Space Models for Dense Video Captioning
par: Piergiovanni, AJ, et autres
Publié: (2025)
par: Piergiovanni, AJ, et autres
Publié: (2025)
Dense Video Captioning using Graph-based Sentence Summarization
par: Zhang, Zhiwang, et autres
Publié: (2025)
par: Zhang, Zhiwang, et autres
Publié: (2025)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
par: Xie, Junyu, et autres
Publié: (2025)
par: Xie, Junyu, et autres
Publié: (2025)
Learning text-to-video retrieval from image captioning
par: Ventura, Lucas, et autres
Publié: (2024)
par: Ventura, Lucas, et autres
Publié: (2024)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
par: Bousselham, Walid, et autres
Publié: (2025)
par: Bousselham, Walid, et autres
Publié: (2025)
Documents similaires
-
Dense Video Object Captioning from Disjoint Supervision
par: Zhou, Xingyi, et autres
Publié: (2023) -
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025) -
VoCap: Video Object Captioning and Segmentation from Any Prompt
par: Uijlings, Jasper, et autres
Publié: (2025) -
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
par: Min, Juhong, et autres
Publié: (2024) -
VicTR: Video-conditioned Text Representations for Activity Recognition
par: Kahatapitiya, Kumara, et autres
Publié: (2023)