Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
Fuente:
arXiv
Salvato in:
| Autore principale: | Tencent Hunyuan Team |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing
di: Tencent HY Team
Pubblicazione: (2026)
di: Tencent HY Team
Pubblicazione: (2026)
AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics
di: Tencent HY Team
Pubblicazione: (2026)
di: Tencent HY Team
Pubblicazione: (2026)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026)
di: Yao, Linli, et al.
Pubblicazione: (2026)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
di: Li, You, et al.
Pubblicazione: (2026)
di: Li, You, et al.
Pubblicazione: (2026)
Exploiting Auxiliary Caption for Video Grounding
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation
di: Suzuki, Rena, et al.
Pubblicazione: (2026)
di: Suzuki, Rena, et al.
Pubblicazione: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
Dual-Stream Collaborative Transformer for Image Captioning
di: Wan, Jun, et al.
Pubblicazione: (2026)
di: Wan, Jun, et al.
Pubblicazione: (2026)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
di: Li, Yizhe, et al.
Pubblicazione: (2025)
di: Li, Yizhe, et al.
Pubblicazione: (2025)
Live Video Captioning
di: Blanco-Fernández, Eduardo, et al.
Pubblicazione: (2024)
di: Blanco-Fernández, Eduardo, et al.
Pubblicazione: (2024)
Infusing Environmental Captions for Long-Form Video Language Grounding
di: Lee, Hyogun, et al.
Pubblicazione: (2024)
di: Lee, Hyogun, et al.
Pubblicazione: (2024)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
di: Mkhallati, Hassan, et al.
Pubblicazione: (2023)
di: Mkhallati, Hassan, et al.
Pubblicazione: (2023)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
di: Athar, Ali, et al.
Pubblicazione: (2024)
di: Athar, Ali, et al.
Pubblicazione: (2024)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
SOVC: Subject-Oriented Video Captioning
di: Teng, Chang, et al.
Pubblicazione: (2023)
di: Teng, Chang, et al.
Pubblicazione: (2023)
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
di: Chaffin, Antoine, et al.
Pubblicazione: (2024)
di: Chaffin, Antoine, et al.
Pubblicazione: (2024)
Audio-Sync Video Generation with Multi-Stream Temporal Control
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions
di: Hur, Chan, et al.
Pubblicazione: (2025)
di: Hur, Chan, et al.
Pubblicazione: (2025)
Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model
di: SII-GAIR, et al.
Pubblicazione: (2026)
di: SII-GAIR, et al.
Pubblicazione: (2026)
MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions
di: Ju, Xuan, et al.
Pubblicazione: (2024)
di: Ju, Xuan, et al.
Pubblicazione: (2024)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
di: Tang, Changli, et al.
Pubblicazione: (2026)
di: Tang, Changli, et al.
Pubblicazione: (2026)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
di: Ding, Ning, et al.
Pubblicazione: (2025)
di: Ding, Ning, et al.
Pubblicazione: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
Top-Down Framework for Weakly-supervised Grounded Image Captioning
di: Cai, Chen, et al.
Pubblicazione: (2023)
di: Cai, Chen, et al.
Pubblicazione: (2023)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
SPRINT: Script-agnostic Structure Recognition in Tables
di: Kudale, Dhruv, et al.
Pubblicazione: (2025)
di: Kudale, Dhruv, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
Group Relative Policy Optimization for Image Captioning
di: Liang, Xu
Pubblicazione: (2025)
di: Liang, Xu
Pubblicazione: (2025)
Documenti analoghi
-
HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing
di: Tencent HY Team
Pubblicazione: (2026) -
AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics
di: Tencent HY Team
Pubblicazione: (2026) -
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026) -
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024) -
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)