Guardado en:
| Autores principales: | Zhang, Xu, Yuan, Jin, Yang, BinHong, Liu, Xuan, Zhang, Qianjun, Wang, Yuyi, Li, Zhiyong, Zhang, Hanwang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.20887 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
por: Tang, Yunlong, et al.
Publicado: (2025)
por: Tang, Yunlong, et al.
Publicado: (2025)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
por: Chu, Sanghyeok, et al.
Publicado: (2025)
por: Chu, Sanghyeok, et al.
Publicado: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
por: Yao, Linli, et al.
Publicado: (2023)
por: Yao, Linli, et al.
Publicado: (2023)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
por: Yao, Linli, et al.
Publicado: (2026)
por: Yao, Linli, et al.
Publicado: (2026)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
por: Zhou, Li, et al.
Publicado: (2024)
por: Zhou, Li, et al.
Publicado: (2024)
Dense Video Captioning using Graph-based Sentence Summarization
por: Zhang, Zhiwang, et al.
Publicado: (2025)
por: Zhang, Zhiwang, et al.
Publicado: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Segment and Caption Anything
por: Huang, Xiaoke, et al.
Publicado: (2023)
por: Huang, Xiaoke, et al.
Publicado: (2023)
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
por: Qiu, Tianheng, et al.
Publicado: (2025)
por: Qiu, Tianheng, et al.
Publicado: (2025)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
por: Lin, Weifeng, et al.
Publicado: (2025)
por: Lin, Weifeng, et al.
Publicado: (2025)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
por: Shen, Xin, et al.
Publicado: (2025)
por: Shen, Xin, et al.
Publicado: (2025)
Accurate and Fast Compressed Video Captioning
por: Shen, Yaojie, et al.
Publicado: (2023)
por: Shen, Yaojie, et al.
Publicado: (2023)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
FSAR-Cap: A Fine-Grained Two-Stage Annotated Dataset for SAR Image Captioning
por: Zhang, Jinqi, et al.
Publicado: (2025)
por: Zhang, Jinqi, et al.
Publicado: (2025)
Retrieval-Augmented Egocentric Video Captioning
por: Xu, Jilan, et al.
Publicado: (2024)
por: Xu, Jilan, et al.
Publicado: (2024)
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
por: Liu, Yuan, et al.
Publicado: (2025)
por: Liu, Yuan, et al.
Publicado: (2025)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
por: Ge, Shiping, et al.
Publicado: (2024)
por: Ge, Shiping, et al.
Publicado: (2024)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
por: Zheng, Guangcong, et al.
Publicado: (2025)
por: Zheng, Guangcong, et al.
Publicado: (2025)
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
por: He, Ziyao, et al.
Publicado: (2026)
por: He, Ziyao, et al.
Publicado: (2026)
MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions
por: Ju, Xuan, et al.
Publicado: (2024)
por: Ju, Xuan, et al.
Publicado: (2024)
Learning to Rank Caption Chains for Video-Text Alignment
por: Blume, Ansel, et al.
Publicado: (2026)
por: Blume, Ansel, et al.
Publicado: (2026)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
por: Shvetsova, Nina, et al.
Publicado: (2023)
por: Shvetsova, Nina, et al.
Publicado: (2023)
Towards Fine-Grained Human Motion Video Captioning
por: Song, Guorui, et al.
Publicado: (2025)
por: Song, Guorui, et al.
Publicado: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
por: Yang, Chenglin, et al.
Publicado: (2023)
por: Yang, Chenglin, et al.
Publicado: (2023)
OmniCaptioner: One Captioner to Rule Them All
por: Lu, Yiting, et al.
Publicado: (2025)
por: Lu, Yiting, et al.
Publicado: (2025)
SnapCap: Efficient Snapshot Compressive Video Captioning
por: Sun, Jianqiao, et al.
Publicado: (2024)
por: Sun, Jianqiao, et al.
Publicado: (2024)
Rule-driven News Captioning
por: Xu, Ning, et al.
Publicado: (2024)
por: Xu, Ning, et al.
Publicado: (2024)
Live Video Captioning
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
por: Blanco-Fernández, Eduardo, et al.
Publicado: (2024)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
por: Jeon, MinJu, et al.
Publicado: (2025)
por: Jeon, MinJu, et al.
Publicado: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
por: Fiastre, Gabriel, et al.
Publicado: (2025)
por: Fiastre, Gabriel, et al.
Publicado: (2025)
Storyboard guided Alignment for Fine-grained Video Action Recognition
por: Liu, Enqi, et al.
Publicado: (2024)
por: Liu, Enqi, et al.
Publicado: (2024)
Transformer with Controlled Attention for Synchronous Motion Captioning
por: Radouane, Karim, et al.
Publicado: (2024)
por: Radouane, Karim, et al.
Publicado: (2024)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
por: Lu, Yifan, et al.
Publicado: (2023)
por: Lu, Yifan, et al.
Publicado: (2023)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
por: Zhang, Junzhe, et al.
Publicado: (2024)
por: Zhang, Junzhe, et al.
Publicado: (2024)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
por: Mkhallati, Hassan, et al.
Publicado: (2023)
por: Mkhallati, Hassan, et al.
Publicado: (2023)
Pretrained Image-Text Models are Secretly Video Captioners
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
Ejemplares similares
-
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
por: Zhang, Xu, et al.
Publicado: (2025) -
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
por: Tang, Yunlong, et al.
Publicado: (2025) -
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
por: Chu, Sanghyeok, et al.
Publicado: (2025) -
Edit As You Wish: Video Caption Editing with Multi-grained User Control
por: Yao, Linli, et al.
Publicado: (2023) -
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
por: Yao, Linli, et al.
Publicado: (2026)