YingVideo-MV: Music-Driven Multi-Stage Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Jiahui, Wang, Weida, Shi, Runhua, Yang, Huan, Ding, Chaofan, Chen, Zihao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation
di: Yang, Huan, et al.
Pubblicazione: (2024)
di: Yang, Huan, et al.
Pubblicazione: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024)
di: Chen, Zihao, et al.
Pubblicazione: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Audio-driven Gesture Generation via Deviation Feature in the Latent Space
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025)
di: Liang, Yunming, et al.
Pubblicazione: (2025)
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
di: Zuo, Qi, et al.
Pubblicazione: (2024)
di: Zuo, Qi, et al.
Pubblicazione: (2024)
MV-TAP: Tracking Any Point in Multi-View Videos
di: Koo, Jahyeok, et al.
Pubblicazione: (2025)
di: Koo, Jahyeok, et al.
Pubblicazione: (2025)
MV2MAE: Multi-View Video Masked Autoencoders
di: Shah, Ketul, et al.
Pubblicazione: (2024)
di: Shah, Ketul, et al.
Pubblicazione: (2024)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
di: He, Zhihao, et al.
Pubblicazione: (2025)
di: He, Zhihao, et al.
Pubblicazione: (2025)
X-Dancer: Expressive Music to Human Dance Video Generation
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
di: Yang, Kaixing, et al.
Pubblicazione: (2025)
di: Yang, Kaixing, et al.
Pubblicazione: (2025)
MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation
di: Wang, Weimin, et al.
Pubblicazione: (2024)
di: Wang, Weimin, et al.
Pubblicazione: (2024)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
di: Chen, Mu, et al.
Pubblicazione: (2025)
di: Chen, Mu, et al.
Pubblicazione: (2025)
Multi-sentence Video Grounding for Long Video Generation
di: Feng, Wei, et al.
Pubblicazione: (2024)
di: Feng, Wei, et al.
Pubblicazione: (2024)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning
di: Chen, Tieyuan, et al.
Pubblicazione: (2024)
di: Chen, Tieyuan, et al.
Pubblicazione: (2024)
MV-S2V: Multi-View Subject-Consistent Video Generation
di: Song, Ziyang, et al.
Pubblicazione: (2026)
di: Song, Ziyang, et al.
Pubblicazione: (2026)
FlashVideo: A Framework for Swift Inference in Text-to-Video Generation
di: Lei, Bin, et al.
Pubblicazione: (2023)
di: Lei, Bin, et al.
Pubblicazione: (2023)
MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
di: Zhi, Yihao, et al.
Pubblicazione: (2025)
di: Zhi, Yihao, et al.
Pubblicazione: (2025)
VidSketch: Hand-drawn Sketch-Driven Video Generation with Diffusion Control
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
PMR: Physical Model-Driven Multi-Stage Restoration of Turbulent Dynamic Videos
di: Wu, Tao, et al.
Pubblicazione: (2025)
di: Wu, Tao, et al.
Pubblicazione: (2025)
AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State
di: Wang, Huimin, et al.
Pubblicazione: (2026)
di: Wang, Huimin, et al.
Pubblicazione: (2026)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
di: Wang, Mengyue, et al.
Pubblicazione: (2025)
di: Wang, Mengyue, et al.
Pubblicazione: (2025)
T-SVG: Text-Driven Stereoscopic Video Generation
di: Jin, Qiao, et al.
Pubblicazione: (2024)
di: Jin, Qiao, et al.
Pubblicazione: (2024)
Enhance-A-Video: Better Generated Video for Free
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
Controllable Generative Video Compression
di: Ding, Ding, et al.
Pubblicazione: (2026)
di: Ding, Ding, et al.
Pubblicazione: (2026)
Versatile Transition Generation with Image-to-Video Diffusion
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation
di: Ding, Ganggui, et al.
Pubblicazione: (2026)
di: Ding, Ganggui, et al.
Pubblicazione: (2026)
VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation
di: Ren, Weiming, et al.
Pubblicazione: (2024)
di: Ren, Weiming, et al.
Pubblicazione: (2024)
Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
di: Kong, Zhe, et al.
Pubblicazione: (2025)
di: Kong, Zhe, et al.
Pubblicazione: (2025)
MV-Adapter: Multi-view Consistent Image Generation Made Easy
di: Huang, Zehuan, et al.
Pubblicazione: (2024)
di: Huang, Zehuan, et al.
Pubblicazione: (2024)
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
di: Eskandar, George, et al.
Pubblicazione: (2026)
di: Eskandar, George, et al.
Pubblicazione: (2026)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Diff-BGM: A Diffusion Model for Video Background Music Generation
di: Li, Sizhe, et al.
Pubblicazione: (2024)
di: Li, Sizhe, et al.
Pubblicazione: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation
di: Yang, Huan, et al.
Pubblicazione: (2024) -
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024) -
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025) -
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
di: Liu, Chang, et al.
Pubblicazione: (2025) -
Audio-driven Gesture Generation via Deviation Feature in the Latent Space
di: Chen, Jiahui, et al.
Pubblicazione: (2025)