Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Jianzong, Lian, Hao, Hao, Dachao, Tian, Ye, Shi, Qingyu, Chen, Biaolong, Jiang, Hao, Tong, Yunhai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
DreamRelation: Bridging Customization and Relation Generation
di: Shi, Qingyu, et al.
Pubblicazione: (2024)
di: Shi, Qingyu, et al.
Pubblicazione: (2024)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
di: Huang, Xiaohu, et al.
Pubblicazione: (2025)
di: Huang, Xiaohu, et al.
Pubblicazione: (2025)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
di: Li, Liyang, et al.
Pubblicazione: (2026)
di: Li, Liyang, et al.
Pubblicazione: (2026)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
di: Tu, Shuyuan, et al.
Pubblicazione: (2026)
di: Tu, Shuyuan, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
Mixup Helps Understanding Multimodal Video Better
di: Ma, Xiaoyu, et al.
Pubblicazione: (2025)
di: Ma, Xiaoyu, et al.
Pubblicazione: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation
di: Chen, Yingjie, et al.
Pubblicazione: (2026)
di: Chen, Yingjie, et al.
Pubblicazione: (2026)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
di: Cui, Bowen, et al.
Pubblicazione: (2026)
di: Cui, Bowen, et al.
Pubblicazione: (2026)
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Relit-LiVE: Relight Video by Jointly Learning Environment Video
di: Xiao, Weiqing, et al.
Pubblicazione: (2026)
di: Xiao, Weiqing, et al.
Pubblicazione: (2026)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
VABench: A Comprehensive Benchmark for Audio-Video Generation
di: Hua, Daili, et al.
Pubblicazione: (2025)
di: Hua, Daili, et al.
Pubblicazione: (2025)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
di: Wang, Duomin, et al.
Pubblicazione: (2025)
di: Wang, Duomin, et al.
Pubblicazione: (2025)
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation Quality
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
di: Huang, Zhe, et al.
Pubblicazione: (2025)
di: Huang, Zhe, et al.
Pubblicazione: (2025)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
di: Ma, Bingqi, et al.
Pubblicazione: (2026)
di: Ma, Bingqi, et al.
Pubblicazione: (2026)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
Motion Control for Enhanced Complex Action Video Generation
di: Zhou, Qiang, et al.
Pubblicazione: (2024)
di: Zhou, Qiang, et al.
Pubblicazione: (2024)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
Seeing Voices: Generating A-Roll Video from Audio with Mirage
di: Sundararaman, Aditi, et al.
Pubblicazione: (2025)
di: Sundararaman, Aditi, et al.
Pubblicazione: (2025)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
di: Gao, Yongbiao, et al.
Pubblicazione: (2024)
di: Gao, Yongbiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
di: Shi, Qingyu, et al.
Pubblicazione: (2025) -
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
di: Wu, Jianzong, et al.
Pubblicazione: (2025) -
DreamRelation: Bridging Customization and Relation Generation
di: Shi, Qingyu, et al.
Pubblicazione: (2024) -
MotionBooth: Motion-Aware Customized Text-to-Video Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024) -
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)