Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Dingyi, Zhan, Chunru, Wang, Ziheng, Wang, Biao, Ge, Tiezheng, Zheng, Bo, Jin, Qin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
par: Hu, Huanran, et autres
Publié: (2026)
par: Hu, Huanran, et autres
Publié: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
par: Zheng, Sixiao, et autres
Publié: (2024)
par: Zheng, Sixiao, et autres
Publié: (2024)
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
par: Yang, Jasmine, et autres
Publié: (2026)
par: Yang, Jasmine, et autres
Publié: (2026)
Co-Director: Agentic Generative Video Storytelling
par: Song, Yale, et autres
Publié: (2026)
par: Song, Yale, et autres
Publié: (2026)
Movie101v2: Improved Movie Narration Benchmark
par: Yue, Zihao, et autres
Publié: (2024)
par: Yue, Zihao, et autres
Publié: (2024)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
Promisedland: An XR Narrative Attraction Integrating Diorama-to-Virtual Workflow and Elemental Storytelling
par: Wang, Xianghan, et autres
Publié: (2025)
par: Wang, Xianghan, et autres
Publié: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025)
par: Sun, Jiahui, et autres
Publié: (2025)
Tube-Structured Incremental Semantic HARQ for Generative Video Receivers
par: Wang, Xuesong, et autres
Publié: (2026)
par: Wang, Xuesong, et autres
Publié: (2026)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
par: Jin, Yili, et autres
Publié: (2024)
par: Jin, Yili, et autres
Publié: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
par: Zhao, Cairong, et autres
Publié: (2024)
par: Zhao, Cairong, et autres
Publié: (2024)
MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals
par: Yu, Lei, et autres
Publié: (2024)
par: Yu, Lei, et autres
Publié: (2024)
Adaptive Offloading and Enhancement for Low-Light Video Analytics on Mobile Devices
par: He, Yuanyi, et autres
Publié: (2024)
par: He, Yuanyi, et autres
Publié: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
par: Zhang, Juan, et autres
Publié: (2024)
par: Zhang, Juan, et autres
Publié: (2024)
Compression Metadata-assisted RoI Extraction and Adaptive Inference for Efficient Video Analytics
par: Wang, Chengzhi, et autres
Publié: (2025)
par: Wang, Chengzhi, et autres
Publié: (2025)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
Semantic-Guided Unsupervised Video Summarization
par: Liu, Haizhou, et autres
Publié: (2026)
par: Liu, Haizhou, et autres
Publié: (2026)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
par: Tong, Haonan, et autres
Publié: (2024)
par: Tong, Haonan, et autres
Publié: (2024)
StreamOptix: A Cross-layer Adaptive Video Delivery Scheme
par: Liu, Mufan, et autres
Publié: (2024)
par: Liu, Mufan, et autres
Publié: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
The Dream Within Huang Long Cave: AI-Driven Interactive Narrative for Family Storytelling and Emotional Reflection
par: Huang, Jiayang, et autres
Publié: (2025)
par: Huang, Jiayang, et autres
Publié: (2025)
Music Grounding by Short Video
par: Xin, Zijie, et autres
Publié: (2024)
par: Xin, Zijie, et autres
Publié: (2024)
Beyond Audio and Pose: A General-Purpose Framework for Video Synchronization
par: Shin, Yosub, et autres
Publié: (2025)
par: Shin, Yosub, et autres
Publié: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Multi-Reference Generative Face Video Compression with Contrastive Learning
par: Konuko, Goluck, et autres
Publié: (2024)
par: Konuko, Goluck, et autres
Publié: (2024)
Personalized Playback Technology: How Short Video Services Create Excellent User Experience
par: Deng, Weihui, et autres
Publié: (2024)
par: Deng, Weihui, et autres
Publié: (2024)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
par: Yu, Jiashuo, et autres
Publié: (2025)
par: Yu, Jiashuo, et autres
Publié: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
Perception-Aware Video Semantic Communication
par: Huang, Yinhuan, et autres
Publié: (2026)
par: Huang, Yinhuan, et autres
Publié: (2026)
Text-to-Audio Generation Synchronized with Videos
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
CLIPRerank: An Extremely Simple Method for Improving Ad-hoc Video Search
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
par: Liu, Dingming, et autres
Publié: (2024)
par: Liu, Dingming, et autres
Publié: (2024)
Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos
par: Tian, Chong, et autres
Publié: (2026)
par: Tian, Chong, et autres
Publié: (2026)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing
par: Wang, Yisu, et autres
Publié: (2025)
par: Wang, Yisu, et autres
Publié: (2025)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
par: Lu, Jiacheng, et autres
Publié: (2025)
par: Lu, Jiacheng, et autres
Publié: (2025)
Hallucination Localization in Video Captioning
par: Nakada, Shota, et autres
Publié: (2025)
par: Nakada, Shota, et autres
Publié: (2025)
Documents similaires
-
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
par: Hu, Huanran, et autres
Publié: (2026) -
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025) -
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023) -
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
par: Zheng, Sixiao, et autres
Publié: (2024) -
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
par: Yang, Jasmine, et autres
Publié: (2026)