TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
Fuente:
arXiv
Guardado en:
| Autores principales: | Yao, Linli, Wei, Yuancheng, Zhang, Yaojie, Li, Lei, Chen, Xinlong, Song, Feifan, Wang, Ziyue, Ouyang, Kun, Liu, Yuanxin, Kong, Lingpeng, Liu, Qi, Wan, Pengfei, Gai, Kun, Zhang, Yuanxing, Sun, Xu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
por: Yao, Linli, et al.
Publicado: (2025)
por: Yao, Linli, et al.
Publicado: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
por: Ren, Shuhuai, et al.
Publicado: (2023)
por: Ren, Shuhuai, et al.
Publicado: (2023)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
por: Chen, Xinlong, et al.
Publicado: (2026)
por: Chen, Xinlong, et al.
Publicado: (2026)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
por: Li, Shicheng, et al.
Publicado: (2025)
por: Li, Shicheng, et al.
Publicado: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
por: Ye, Zixuan, et al.
Publicado: (2025)
por: Ye, Zixuan, et al.
Publicado: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
RACap: Relation-Aware Prompting for Lightweight Retrieval-Augmented Image Captioning
por: Long, Xiaosheng, et al.
Publicado: (2025)
por: Long, Xiaosheng, et al.
Publicado: (2025)
DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems
por: Yang, Yiqing, et al.
Publicado: (2026)
por: Yang, Yiqing, et al.
Publicado: (2026)
Accurate and Fast Compressed Video Captioning
por: Shen, Yaojie, et al.
Publicado: (2023)
por: Shen, Yaojie, et al.
Publicado: (2023)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
por: Mei, Xinhao, et al.
Publicado: (2023)
por: Mei, Xinhao, et al.
Publicado: (2023)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
por: Wang, Yuchi, et al.
Publicado: (2025)
por: Wang, Yuchi, et al.
Publicado: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
por: He, Ziyao, et al.
Publicado: (2026)
por: He, Ziyao, et al.
Publicado: (2026)
Temporal Reasoning Transfer from Text to Video
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes
por: Jin, Bu, et al.
Publicado: (2024)
por: Jin, Bu, et al.
Publicado: (2024)
TADACap: Time-series Adaptive Domain-Aware Captioning
por: Fons, Elizabeth, et al.
Publicado: (2025)
por: Fons, Elizabeth, et al.
Publicado: (2025)
ViDiC: Video Difference Captioning
por: Wu, Jiangtao, et al.
Publicado: (2025)
por: Wu, Jiangtao, et al.
Publicado: (2025)
Semantic-Aware Confidence Calibration for Automated Audio Captioning
por: Dunker, Lucas, et al.
Publicado: (2025)
por: Dunker, Lucas, et al.
Publicado: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
TAC: Timestamped Audio Captioning
por: Kumar, Sonal, et al.
Publicado: (2026)
por: Kumar, Sonal, et al.
Publicado: (2026)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
Scaling Image and Video Generation via Test-Time Evolutionary Search
por: He, Haoran, et al.
Publicado: (2025)
por: He, Haoran, et al.
Publicado: (2025)
EvolveCaptions: Empowering DHH Users Through Real-Time Collaborative Captioning
por: Wu, Liang-Yuan, et al.
Publicado: (2025)
por: Wu, Liang-Yuan, et al.
Publicado: (2025)
Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
por: Tencent Hunyuan Team
Publicado: (2026)
por: Tencent Hunyuan Team
Publicado: (2026)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
por: Zhang, Junzhe, et al.
Publicado: (2024)
por: Zhang, Junzhe, et al.
Publicado: (2024)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025)
por: Wang, Qixun, et al.
Publicado: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Panoptic Captioning: An Equivalence Bridge for Image and Text
por: Lin, Kun-Yu, et al.
Publicado: (2025)
por: Lin, Kun-Yu, et al.
Publicado: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
por: Liu, Jizhong, et al.
Publicado: (2024)
por: Liu, Jizhong, et al.
Publicado: (2024)
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
RECAP: Retrieval-Augmented Audio Captioning
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
por: Huang, Yuzhou, et al.
Publicado: (2025)
por: Huang, Yuzhou, et al.
Publicado: (2025)
Ejemplares similares
-
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
por: Yao, Linli, et al.
Publicado: (2025) -
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
por: Ren, Shuhuai, et al.
Publicado: (2023) -
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
por: Chen, Xinlong, et al.
Publicado: (2025) -
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025) -
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
por: Chen, Xinlong, et al.
Publicado: (2026)