MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Mingzhen, Wang, Weining, Qiao, Yanyuan, Sun, Jiahui, Qin, Zihan, Guo, Longteng, Zhu, Xinxin, Liu, Jing |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
COMUNI: Decomposing Common and Unique Video Signals for Diffusion-based Video Generation
by: Sun, Mingzhen, et al.
Published: (2024)
by: Sun, Mingzhen, et al.
Published: (2024)
VL-Mamba: Exploring State Space Models for Multimodal Learning
by: Qiao, Yanyuan, et al.
Published: (2024)
by: Qiao, Yanyuan, et al.
Published: (2024)
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
by: Sun, Mingzhen, et al.
Published: (2025)
by: Sun, Mingzhen, et al.
Published: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
by: Sun, Jiahui, et al.
Published: (2025)
by: Sun, Jiahui, et al.
Published: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
by: Zhang, Siqi, et al.
Published: (2025)
by: Zhang, Siqi, et al.
Published: (2025)
VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis
by: Wu, Shiyu, et al.
Published: (2025)
by: Wu, Shiyu, et al.
Published: (2025)
StructLDM: Structured Latent Diffusion for 3D Human Generation
by: Hu, Tao, et al.
Published: (2024)
by: Hu, Tao, et al.
Published: (2024)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
by: Liu, Jing, et al.
Published: (2023)
by: Liu, Jing, et al.
Published: (2023)
ZoomLDM: Latent Diffusion Model for multi-scale image generation
by: Yellapragada, Srikar, et al.
Published: (2024)
by: Yellapragada, Srikar, et al.
Published: (2024)
TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement
by: Luo, Wenhao, et al.
Published: (2025)
by: Luo, Wenhao, et al.
Published: (2025)
LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models
by: Wen, Qiang, et al.
Published: (2023)
by: Wen, Qiang, et al.
Published: (2023)
Flood-LDM: Generalizable Latent Diffusion Models for rapid and accurate zero-shot High-Resolution Flood Mapping
by: Neo, Sun Han, et al.
Published: (2025)
by: Neo, Sun Han, et al.
Published: (2025)
SG-LDM: Semantic-Guided LiDAR Generation via Latent-Aligned Diffusion
by: Xiang, Zhengkang, et al.
Published: (2025)
by: Xiang, Zhengkang, et al.
Published: (2025)
SWA-LDM: Toward Stealthy Watermarks for Latent Diffusion Models
by: Yang, Zhonghao, et al.
Published: (2025)
by: Yang, Zhonghao, et al.
Published: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
by: Bernini Team, et al.
Published: (2026)
by: Bernini Team, et al.
Published: (2026)
RepLDM: Reprogramming Pretrained Latent Diffusion Models for High-Quality, High-Efficiency, High-Resolution Image Generation
by: Cao, Boyuan, et al.
Published: (2024)
by: Cao, Boyuan, et al.
Published: (2024)
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
by: Yue, Tongtian, et al.
Published: (2025)
by: Yue, Tongtian, et al.
Published: (2025)
LPUWF-LDM: Enhanced Latent Diffusion Model for Precise Late-phase UWF-FA Generation on Limited Dataset
by: Fang, Zhaojie, et al.
Published: (2024)
by: Fang, Zhaojie, et al.
Published: (2024)
BS-LDM: Effective Bone Suppression in High-Resolution Chest X-Ray Images with Conditional Latent Diffusion Models
by: Sun, Yifei, et al.
Published: (2024)
by: Sun, Yifei, et al.
Published: (2024)
ORL-LDM: Offline Reinforcement Learning Guided Latent Diffusion Model Super-Resolution Reconstruction
by: Lyu, Shijie
Published: (2025)
by: Lyu, Shijie
Published: (2025)
Latte: Latent Diffusion Transformer for Video Generation
by: Ma, Xin, et al.
Published: (2024)
by: Ma, Xin, et al.
Published: (2024)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
by: Guo, Longteng, et al.
Published: (2026)
by: Guo, Longteng, et al.
Published: (2026)
SLaM-DiMM: Shared Latent Modeling for Diffusion Based Missing Modality Synthesis in MRI
by: Sandbhor, Bhavesh, et al.
Published: (2025)
by: Sandbhor, Bhavesh, et al.
Published: (2025)
Semantic-Enriched Latent Visual Reasoning
by: Xu, Tianrun, et al.
Published: (2026)
by: Xu, Tianrun, et al.
Published: (2026)
SAT-LDM: Provably Generalizable Image Watermarking for Latent Diffusion Models with Self-Augmented Training
by: Zhang, Lu, et al.
Published: (2024)
by: Zhang, Lu, et al.
Published: (2024)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
by: Li, Handong, et al.
Published: (2025)
by: Li, Handong, et al.
Published: (2025)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
by: Song, Xiufeng, et al.
Published: (2024)
by: Song, Xiufeng, et al.
Published: (2024)
LDM-Morph: Latent diffusion model guided deformable image registration
by: Wu, Jiong, et al.
Published: (2024)
by: Wu, Jiong, et al.
Published: (2024)
UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration
by: He, Chunming, et al.
Published: (2025)
by: He, Chunming, et al.
Published: (2025)
ReF-LDM: A Latent Diffusion Model for Reference-based Face Image Restoration
by: Hsiao, Chi-Wei, et al.
Published: (2024)
by: Hsiao, Chi-Wei, et al.
Published: (2024)
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
by: Duan, Zhongjie, et al.
Published: (2024)
by: Duan, Zhongjie, et al.
Published: (2024)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
by: Yin, Xiangchen, et al.
Published: (2025)
by: Yin, Xiangchen, et al.
Published: (2025)
NeRF On-the-go: Exploiting Uncertainty for Distractor-free NeRFs in the Wild
by: Ren, Weining, et al.
Published: (2024)
by: Ren, Weining, et al.
Published: (2024)
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
by: Wei, Lai, et al.
Published: (2023)
by: Wei, Lai, et al.
Published: (2023)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
by: Zhang, Haiyu, et al.
Published: (2024)
by: Zhang, Haiyu, et al.
Published: (2024)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
by: Zhai, Yuanhao, et al.
Published: (2024)
by: Zhai, Yuanhao, et al.
Published: (2024)
Diffusion Models For Multi-Modal Generative Modeling
by: Chen, Changyou, et al.
Published: (2024)
by: Chen, Changyou, et al.
Published: (2024)
GM-LDM: Latent Diffusion Model for Brain Biomarker Identification through Functional Data-Driven Gray Matter Synthesis
by: Xu, Hu, et al.
Published: (2025)
by: Xu, Hu, et al.
Published: (2025)
GDTS: Goal-Guided Diffusion Model with Tree Sampling for Multi-Modal Pedestrian Trajectory Prediction
by: Sun, Ge, et al.
Published: (2023)
by: Sun, Ge, et al.
Published: (2023)
MM-Diff: High-Fidelity Image Personalization via Multi-Modal Condition Integration
by: Wei, Zhichao, et al.
Published: (2024)
by: Wei, Zhichao, et al.
Published: (2024)
Similar Items
-
COMUNI: Decomposing Common and Unique Video Signals for Diffusion-based Video Generation
by: Sun, Mingzhen, et al.
Published: (2024) -
VL-Mamba: Exploring State Space Models for Multimodal Learning
by: Qiao, Yanyuan, et al.
Published: (2024) -
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
by: Sun, Mingzhen, et al.
Published: (2025) -
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
by: Sun, Jiahui, et al.
Published: (2025) -
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
by: Zhang, Siqi, et al.
Published: (2025)