LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Hongchen, Tan, Zhihong, Hu, Yaosi, Chen, Chang Wen, Chen, Zhenzhong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Context Window Extension: A New Perspective for Long Video Understanding
par: Wei, Hongchen, et autres
Publié: (2024)
par: Wei, Hongchen, et autres
Publié: (2024)
LaMD: Latent Motion Diffusion for Image-Conditional Video Generation
par: Hu, Yaosi, et autres
Publié: (2023)
par: Hu, Yaosi, et autres
Publié: (2023)
RSFAKE-1M: A Large-Scale Dataset for Detecting Diffusion-Generated Remote Sensing Forgeries
par: Tan, Zhihong, et autres
Publié: (2025)
par: Tan, Zhihong, et autres
Publié: (2025)
Training-Free Reasoning and Reflection in MLLMs
par: Wei, Hongchen, et autres
Publié: (2025)
par: Wei, Hongchen, et autres
Publié: (2025)
Addressing the ID-Matching Challenge in Long Video Captioning
par: Yang, Zhantao, et autres
Publié: (2025)
par: Yang, Zhantao, et autres
Publié: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
par: Zheng, Guangcong, et autres
Publié: (2025)
par: Zheng, Guangcong, et autres
Publié: (2025)
Exploiting Auxiliary Caption for Video Grounding
par: Li, Hongxiang, et autres
Publié: (2023)
par: Li, Hongxiang, et autres
Publié: (2023)
DreamLIP: Language-Image Pre-training with Long Captions
par: Zheng, Kecheng, et autres
Publié: (2024)
par: Zheng, Kecheng, et autres
Publié: (2024)
MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions
par: Ju, Xuan, et autres
Publié: (2024)
par: Ju, Xuan, et autres
Publié: (2024)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
par: Gao, Yiling, et autres
Publié: (2026)
par: Gao, Yiling, et autres
Publié: (2026)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
par: Chu, Sanghyeok, et autres
Publié: (2025)
par: Chu, Sanghyeok, et autres
Publié: (2025)
Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning
par: Xi, Zeyu, et autres
Publié: (2025)
par: Xi, Zeyu, et autres
Publié: (2025)
Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2024)
par: Kazakos, Evangelos, et autres
Publié: (2024)
Technical Report for Soccernet 2023 -- Dense Video Captioning
par: Ruan, Zheng, et autres
Publié: (2024)
par: Ruan, Zheng, et autres
Publié: (2024)
Encoder-Decoder Based Long Short-Term Memory (LSTM) Model for Video Captioning
par: Adewale, Sikiru, et autres
Publié: (2023)
par: Adewale, Sikiru, et autres
Publié: (2023)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
par: Tang, Yunlong, et autres
Publié: (2025)
par: Tang, Yunlong, et autres
Publié: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
Controllable Hybrid Captioner for Improved Long-form Video Understanding
par: Sasse, Kuleen, et autres
Publié: (2025)
par: Sasse, Kuleen, et autres
Publié: (2025)
Infusing Environmental Captions for Long-Form Video Language Grounding
par: Lee, Hyogun, et autres
Publié: (2024)
par: Lee, Hyogun, et autres
Publié: (2024)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
ViDiC: Video Difference Captioning
par: Wu, Jiangtao, et autres
Publié: (2025)
par: Wu, Jiangtao, et autres
Publié: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
SOVC: Subject-Oriented Video Captioning
par: Teng, Chang, et autres
Publié: (2023)
par: Teng, Chang, et autres
Publié: (2023)
XMeCap: Meme Caption Generation with Sub-Image Adaptability
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Live Video Captioning
par: Blanco-Fernández, Eduardo, et autres
Publié: (2024)
par: Blanco-Fernández, Eduardo, et autres
Publié: (2024)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
par: Salazar, Israfel, et autres
Publié: (2025)
par: Salazar, Israfel, et autres
Publié: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
Retrieval-Augmented Egocentric Video Captioning
par: Xu, Jilan, et autres
Publié: (2024)
par: Xu, Jilan, et autres
Publié: (2024)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025)
par: Wysoczańska, Monika, et autres
Publié: (2025)
Dual-path Collaborative Generation Network for Emotional Video Captioning
par: Ye, Cheng, et autres
Publié: (2024)
par: Ye, Cheng, et autres
Publié: (2024)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
par: Yu, Linhao, et autres
Publié: (2025)
par: Yu, Linhao, et autres
Publié: (2025)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
par: Yashima, Daichi, et autres
Publié: (2026)
par: Yashima, Daichi, et autres
Publié: (2026)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024)
par: Chen, Sishuo, et autres
Publié: (2024)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
par: Wang, Jiale, et autres
Publié: (2026)
par: Wang, Jiale, et autres
Publié: (2026)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
par: Mkhallati, Hassan, et autres
Publié: (2023)
par: Mkhallati, Hassan, et autres
Publié: (2023)
From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding
par: Lin, Shih-Yao, et autres
Publié: (2025)
par: Lin, Shih-Yao, et autres
Publié: (2025)
LOP: Learning Optimal Pruning for Efficient On-Demand MLLMs Scaling
par: Zhang, Zhihan, et autres
Publié: (2025)
par: Zhang, Zhihan, et autres
Publié: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
par: Yao, Linli, et autres
Publié: (2026)
par: Yao, Linli, et autres
Publié: (2026)
Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
par: Zhou, Li, et autres
Publié: (2024)
par: Zhou, Li, et autres
Publié: (2024)
Documents similaires
-
Visual Context Window Extension: A New Perspective for Long Video Understanding
par: Wei, Hongchen, et autres
Publié: (2024) -
LaMD: Latent Motion Diffusion for Image-Conditional Video Generation
par: Hu, Yaosi, et autres
Publié: (2023) -
RSFAKE-1M: A Large-Scale Dataset for Detecting Diffusion-Generated Remote Sensing Forgeries
par: Tan, Zhihong, et autres
Publié: (2025) -
Training-Free Reasoning and Reflection in MLLMs
par: Wei, Hongchen, et autres
Publié: (2025) -
Addressing the ID-Matching Challenge in Long Video Captioning
par: Yang, Zhantao, et autres
Publié: (2025)