JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Kwon, Mingi, Shin, Joonghyuk, Jung, Jaeseok, Park, Jaesik, Uh, Youngjung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026)
di: Brunetto, Amandine
Pubblicazione: (2026)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
di: Cheng, Ho Kei, et al.
Pubblicazione: (2024)
di: Cheng, Ho Kei, et al.
Pubblicazione: (2024)
SAVE: Segment Audio-Visual Easy way using Segment Anything Model
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
di: Liu, Zihao, et al.
Pubblicazione: (2025)
di: Liu, Zihao, et al.
Pubblicazione: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
di: Li, Shufan, et al.
Pubblicazione: (2024)
di: Li, Shufan, et al.
Pubblicazione: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
di: Shen, Shuai, et al.
Pubblicazione: (2025)
di: Shen, Shuai, et al.
Pubblicazione: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
As Good as It KAN Get: High-Fidelity Audio Representation
di: Marszałek, Patryk, et al.
Pubblicazione: (2025)
di: Marszałek, Patryk, et al.
Pubblicazione: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
di: Tegler, Erik, et al.
Pubblicazione: (2024)
di: Tegler, Erik, et al.
Pubblicazione: (2024)
UniSync: A Unified Framework for Audio-Visual Synchronization
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
di: Fu, Ao, et al.
Pubblicazione: (2025)
di: Fu, Ao, et al.
Pubblicazione: (2025)
Deep Active Audio Feature Learning in Resource-Constrained Environments
di: Mohaimenuzzaman, Md, et al.
Pubblicazione: (2023)
di: Mohaimenuzzaman, Md, et al.
Pubblicazione: (2023)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
di: Barik, Ayush, et al.
Pubblicazione: (2026)
di: Barik, Ayush, et al.
Pubblicazione: (2026)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
di: Lai, Yung-Hsuan, et al.
Pubblicazione: (2025)
di: Lai, Yung-Hsuan, et al.
Pubblicazione: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
Documenti analoghi
-
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025) -
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026) -
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
di: Wang, Yongqi, et al.
Pubblicazione: (2024) -
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025) -
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)