Guardado en:
| Autores principales: | Paredes, David Miranda, Saavedra, Jose M., Pizarro, Marcelo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.27662 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
por: Wu, Peiran, et al.
Publicado: (2025)
por: Wu, Peiran, et al.
Publicado: (2025)
iDocV2: Leveraging Self-Supervision and Open-Set Detection for Improving Pattern Spotting in Historical Documents
por: Saavedra, Jose M., et al.
Publicado: (2026)
por: Saavedra, Jose M., et al.
Publicado: (2026)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
por: Chai, Wenhao, et al.
Publicado: (2024)
por: Chai, Wenhao, et al.
Publicado: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
por: Wei, Hongchen, et al.
Publicado: (2025)
por: Wei, Hongchen, et al.
Publicado: (2025)
Open-Sora Plan: Open-Source Large Video Generation Model
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
Live Video Captioning
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
por: Yashima, Daichi, et al.
Publicado: (2026)
por: Yashima, Daichi, et al.
Publicado: (2026)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
por: Yu, Linhao, et al.
Publicado: (2025)
por: Yu, Linhao, et al.
Publicado: (2025)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
UniVid: The Open-Source Unified Video Model
por: Luo, Jiabin, et al.
Publicado: (2025)
por: Luo, Jiabin, et al.
Publicado: (2025)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
por: Hu, Shiyu, et al.
Publicado: (2024)
por: Hu, Shiyu, et al.
Publicado: (2024)
Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark
por: Xi, Zeyu, et al.
Publicado: (2024)
por: Xi, Zeyu, et al.
Publicado: (2024)
Grounded Video Caption Generation
por: Kazakos, Evangelos, et al.
Publicado: (2024)
por: Kazakos, Evangelos, et al.
Publicado: (2024)
Streaming Dense Video Captioning
por: Zhou, Xingyi, et al.
Publicado: (2024)
por: Zhou, Xingyi, et al.
Publicado: (2024)
Large-scale Pre-training for Grounded Video Caption Generation
por: Kazakos, Evangelos, et al.
Publicado: (2025)
por: Kazakos, Evangelos, et al.
Publicado: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
por: Jeon, MinJu, et al.
Publicado: (2025)
por: Jeon, MinJu, et al.
Publicado: (2025)
Dense Video Captioning Using Unsupervised Semantic Information
por: Estevam, Valter, et al.
Publicado: (2021)
por: Estevam, Valter, et al.
Publicado: (2021)
Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning
por: Xi, Zeyu, et al.
Publicado: (2025)
por: Xi, Zeyu, et al.
Publicado: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
Beyond Caption-Based Queries for Video Moment Retrieval
por: Pujol-Perich, David, et al.
Publicado: (2026)
por: Pujol-Perich, David, et al.
Publicado: (2026)
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
por: Wang, Yueqian, et al.
Publicado: (2025)
por: Wang, Yueqian, et al.
Publicado: (2025)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
por: Guo, Haiyang, et al.
Publicado: (2026)
por: Guo, Haiyang, et al.
Publicado: (2026)
Exploiting Auxiliary Caption for Video Grounding
por: Li, Hongxiang, et al.
Publicado: (2023)
por: Li, Hongxiang, et al.
Publicado: (2023)
Progress-Aware Video Frame Captioning
por: Xue, Zihui, et al.
Publicado: (2024)
por: Xue, Zihui, et al.
Publicado: (2024)
Retrieval-Augmented Egocentric Video Captioning
por: Xu, Jilan, et al.
Publicado: (2024)
por: Xu, Jilan, et al.
Publicado: (2024)
SOVC: Subject-Oriented Video Captioning
por: Teng, Chang, et al.
Publicado: (2023)
por: Teng, Chang, et al.
Publicado: (2023)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
por: Kim, Younggun, et al.
Publicado: (2025)
por: Kim, Younggun, et al.
Publicado: (2025)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
por: Mkhallati, Hassan, et al.
Publicado: (2023)
por: Mkhallati, Hassan, et al.
Publicado: (2023)
A Video is Worth 10,000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval
por: Gwilliam, Matthew, et al.
Publicado: (2023)
por: Gwilliam, Matthew, et al.
Publicado: (2023)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
por: Xue, Zhucun, et al.
Publicado: (2025)
por: Xue, Zhucun, et al.
Publicado: (2025)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
por: Ge, Mengying, et al.
Publicado: (2024)
por: Ge, Mengying, et al.
Publicado: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
por: Li, Shihao, et al.
Publicado: (2025)
por: Li, Shihao, et al.
Publicado: (2025)
Time-Scaling State-Space Models for Dense Video Captioning
por: Piergiovanni, AJ, et al.
Publicado: (2025)
por: Piergiovanni, AJ, et al.
Publicado: (2025)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
ViDiC: Video Difference Captioning
por: Wu, Jiangtao, et al.
Publicado: (2025)
por: Wu, Jiangtao, et al.
Publicado: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
por: Chen, Lin, et al.
Publicado: (2024)
por: Chen, Lin, et al.
Publicado: (2024)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
por: Wang, Jiale, et al.
Publicado: (2026)
por: Wang, Jiale, et al.
Publicado: (2026)
Ejemplares similares
-
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023) -
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
por: Wu, Peiran, et al.
Publicado: (2025) -
iDocV2: Leveraging Self-Supervision and Open-Set Detection for Improving Pattern Spotting in Historical Documents
por: Saavedra, Jose M., et al.
Publicado: (2026) -
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
por: Chai, Wenhao, et al.
Publicado: (2024) -
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
por: Wei, Hongchen, et al.
Publicado: (2025)