Enregistré dans:
| Auteurs principaux: | Chen, Jiahui, Wang, Weida, Shi, Runhua, Yang, Huan, Ding, Chaofan, Chen, Zihao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.02492 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation
par: Yang, Huan, et autres
Publié: (2024)
par: Yang, Huan, et autres
Publié: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Audio-driven Gesture Generation via Deviation Feature in the Latent Space
par: Chen, Jiahui, et autres
Publié: (2025)
par: Chen, Jiahui, et autres
Publié: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
par: Tang, Xiaoxuan, et autres
Publié: (2025)
par: Tang, Xiaoxuan, et autres
Publié: (2025)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)
par: Liang, Yunming, et autres
Publié: (2025)
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024)
par: Zuo, Qi, et autres
Publié: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
par: He, Zhihao, et autres
Publié: (2025)
par: He, Zhihao, et autres
Publié: (2025)
MV-TAP: Tracking Any Point in Multi-View Videos
par: Koo, Jahyeok, et autres
Publié: (2025)
par: Koo, Jahyeok, et autres
Publié: (2025)
MV2MAE: Multi-View Video Masked Autoencoders
par: Shah, Ketul, et autres
Publié: (2024)
par: Shah, Ketul, et autres
Publié: (2024)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
X-Dancer: Expressive Music to Human Dance Video Generation
par: Chen, Zeyuan, et autres
Publié: (2025)
par: Chen, Zeyuan, et autres
Publié: (2025)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning
par: Chen, Tieyuan, et autres
Publié: (2024)
par: Chen, Tieyuan, et autres
Publié: (2024)
MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation
par: Wang, Weimin, et autres
Publié: (2024)
par: Wang, Weimin, et autres
Publié: (2024)
MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
par: Yang, Kaixing, et autres
Publié: (2025)
par: Yang, Kaixing, et autres
Publié: (2025)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
par: Chen, Mu, et autres
Publié: (2025)
par: Chen, Mu, et autres
Publié: (2025)
VidSketch: Hand-drawn Sketch-Driven Video Generation with Diffusion Control
par: Jiang, Lifan, et autres
Publié: (2025)
par: Jiang, Lifan, et autres
Publié: (2025)
MV-S2V: Multi-View Subject-Consistent Video Generation
par: Song, Ziyang, et autres
Publié: (2026)
par: Song, Ziyang, et autres
Publié: (2026)
Multi-sentence Video Grounding for Long Video Generation
par: Feng, Wei, et autres
Publié: (2024)
par: Feng, Wei, et autres
Publié: (2024)
AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State
par: Wang, Huimin, et autres
Publié: (2026)
par: Wang, Huimin, et autres
Publié: (2026)
FlashVideo: A Framework for Swift Inference in Text-to-Video Generation
par: Lei, Bin, et autres
Publié: (2023)
par: Lei, Bin, et autres
Publié: (2023)
MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
par: Zhi, Yihao, et autres
Publié: (2025)
par: Zhi, Yihao, et autres
Publié: (2025)
PMR: Physical Model-Driven Multi-Stage Restoration of Turbulent Dynamic Videos
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Hyper-3DG: Text-to-3D Gaussian Generation via Hypergraph
par: Di, Donglin, et autres
Publié: (2024)
par: Di, Donglin, et autres
Publié: (2024)
Versatile Transition Generation with Image-to-Video Diffusion
par: Yang, Zuhao, et autres
Publié: (2025)
par: Yang, Zuhao, et autres
Publié: (2025)
Controllable Generative Video Compression
par: Ding, Ding, et autres
Publié: (2026)
par: Ding, Ding, et autres
Publié: (2026)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
par: Wang, Mengyue, et autres
Publié: (2025)
par: Wang, Mengyue, et autres
Publié: (2025)
VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation
par: Ren, Weiming, et autres
Publié: (2024)
par: Ren, Weiming, et autres
Publié: (2024)
Enhance-A-Video: Better Generated Video for Free
par: Luo, Yang, et autres
Publié: (2025)
par: Luo, Yang, et autres
Publié: (2025)
T-SVG: Text-Driven Stereoscopic Video Generation
par: Jin, Qiao, et autres
Publié: (2024)
par: Jin, Qiao, et autres
Publié: (2024)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning
par: Chen, Tieyuan, et autres
Publié: (2025)
par: Chen, Tieyuan, et autres
Publié: (2025)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
Generalizing to Out-of-Sample Degradations via Model Reprogramming
par: Jiang, Runhua, et autres
Publié: (2024)
par: Jiang, Runhua, et autres
Publié: (2024)
FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation
par: Ding, Ganggui, et autres
Publié: (2026)
par: Ding, Ganggui, et autres
Publié: (2026)
MV-Adapter: Multi-view Consistent Image Generation Made Easy
par: Huang, Zehuan, et autres
Publié: (2024)
par: Huang, Zehuan, et autres
Publié: (2024)
Documents similaires
-
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation
par: Yang, Huan, et autres
Publié: (2024) -
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024) -
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025) -
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
par: Liu, Chang, et autres
Publié: (2025) -
Audio-driven Gesture Generation via Deviation Feature in the Latent Space
par: Chen, Jiahui, et autres
Publié: (2025)