Live Video Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Blanco-Fernández, Eduardo, Gutiérrez-Álvarez, Carlos, Nasri, Nadia, Maldonado-Bascón, Saturnino, López-Sastre, Roberto J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Realistic Continual Learning Approach using Pre-trained Models
di: Nasri, Nadia, et al.
Pubblicazione: (2024)
di: Nasri, Nadia, et al.
Pubblicazione: (2024)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
Visual Semantic Navigation with Real Robots
di: Gutiérrez-Álvarez, Carlos, et al.
Pubblicazione: (2023)
di: Gutiérrez-Álvarez, Carlos, et al.
Pubblicazione: (2023)
SEMNAV: Enhancing Visual Semantic Navigation in Robotics through Semantic Segmentation
di: Flor-Rodríguez, Rafael, et al.
Pubblicazione: (2025)
di: Flor-Rodríguez, Rafael, et al.
Pubblicazione: (2025)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
di: Mkhallati, Hassan, et al.
Pubblicazione: (2023)
di: Mkhallati, Hassan, et al.
Pubblicazione: (2023)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
Exploiting Auxiliary Caption for Video Grounding
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
SOVC: Subject-Oriented Video Captioning
di: Teng, Chang, et al.
Pubblicazione: (2023)
di: Teng, Chang, et al.
Pubblicazione: (2023)
Implicit and Explicit Commonsense for Multi-sentence Video Captioning
di: Chou, Shih-Han, et al.
Pubblicazione: (2023)
di: Chou, Shih-Han, et al.
Pubblicazione: (2023)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
di: Ding, Ning, et al.
Pubblicazione: (2025)
di: Ding, Ning, et al.
Pubblicazione: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
ViDiC: Video Difference Captioning
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
di: Zhang, Xu, et al.
Pubblicazione: (2026)
di: Zhang, Xu, et al.
Pubblicazione: (2026)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026)
di: Yao, Linli, et al.
Pubblicazione: (2026)
SnapCap: Efficient Snapshot Compressive Video Captioning
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
Technical Report for Soccernet 2023 -- Dense Video Captioning
di: Ruan, Zheng, et al.
Pubblicazione: (2024)
di: Ruan, Zheng, et al.
Pubblicazione: (2024)
Dense Video Captioning Using Unsupervised Semantic Information
di: Estevam, Valter, et al.
Pubblicazione: (2021)
di: Estevam, Valter, et al.
Pubblicazione: (2021)
Addressing the ID-Matching Challenge in Long Video Captioning
di: Yang, Zhantao, et al.
Pubblicazione: (2025)
di: Yang, Zhantao, et al.
Pubblicazione: (2025)
Dense Video Object Captioning from Disjoint Supervision
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
di: Zhou, Xingyi, et al.
Pubblicazione: (2023)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
Instance-Aligned Captions for Explainable Video Anomaly Detection
di: Song, Inpyo, et al.
Pubblicazione: (2026)
di: Song, Inpyo, et al.
Pubblicazione: (2026)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
di: Chen, Lin, et al.
Pubblicazione: (2024)
di: Chen, Lin, et al.
Pubblicazione: (2024)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Pseudo-labeling with Keyword Refining for Few-Supervised Video Captioning
di: Li, Ping, et al.
Pubblicazione: (2024)
di: Li, Ping, et al.
Pubblicazione: (2024)
Dual-path Collaborative Generation Network for Emotional Video Captioning
di: Ye, Cheng, et al.
Pubblicazione: (2024)
di: Ye, Cheng, et al.
Pubblicazione: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
di: Li, Shihao, et al.
Pubblicazione: (2025)
di: Li, Shihao, et al.
Pubblicazione: (2025)
SGCap: Decoding Semantic Group for Zero-shot Video Captioning
di: Pan, Zeyu, et al.
Pubblicazione: (2025)
di: Pan, Zeyu, et al.
Pubblicazione: (2025)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
di: Shvetsova, Nina, et al.
Pubblicazione: (2023)
di: Shvetsova, Nina, et al.
Pubblicazione: (2023)
Time-Scaling State-Space Models for Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
di: Lu, Yifan, et al.
Pubblicazione: (2023)
di: Lu, Yifan, et al.
Pubblicazione: (2023)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Realistic Continual Learning Approach using Pre-trained Models
di: Nasri, Nadia, et al.
Pubblicazione: (2024) -
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025) -
Visual Semantic Navigation with Real Robots
di: Gutiérrez-Álvarez, Carlos, et al.
Pubblicazione: (2023) -
SEMNAV: Enhancing Visual Semantic Navigation in Robotics through Semantic Segmentation
di: Flor-Rodríguez, Rafael, et al.
Pubblicazione: (2025) -
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)