Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yaxuan, Jiang, Han, Ma, Yifei, Qin, Shihua, Woo, Jonghye, Xing, Fangxu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech motion anomaly detection via cross-modal translation of 4D motion fields from tagged MRI
par: Liu, Xiaofeng, et autres
Publié: (2024)
par: Liu, Xiaofeng, et autres
Publié: (2024)
Semi-Supervised Bone Marrow Lesion Detection from Knee MRI Segmentation Using Mask Inpainting Models
par: Qin, Shihua, et autres
Publié: (2024)
par: Qin, Shihua, et autres
Publié: (2024)
SIREM: Speech-Informed MRI Reconstruction with Learned Sampling
par: Hasan, Md, et autres
Publié: (2026)
par: Hasan, Md, et autres
Publié: (2026)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026)
par: Tateishi, Kazuya, et autres
Publié: (2026)
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
par: Ton, Tri, et autres
Publié: (2025)
par: Ton, Tri, et autres
Publié: (2025)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
par: Li, Kai, et autres
Publié: (2022)
par: Li, Kai, et autres
Publié: (2022)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
par: Guan, Kaisi, et autres
Publié: (2025)
par: Guan, Kaisi, et autres
Publié: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
par: OpenMOSS Team, et autres
Publié: (2026)
par: OpenMOSS Team, et autres
Publié: (2026)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
par: Chu, Xuangeng, et autres
Publié: (2025)
par: Chu, Xuangeng, et autres
Publié: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
par: Cheng, Hao, et autres
Publié: (2025)
par: Cheng, Hao, et autres
Publié: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
WavFlow: Audio Generation in Waveform Space
par: Zhou, Feiyan, et autres
Publié: (2026)
par: Zhou, Feiyan, et autres
Publié: (2026)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
par: Mu, Zhaoxi, et autres
Publié: (2024)
par: Mu, Zhaoxi, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Audiovisual Masked Autoencoders
par: Georgescu, Mariana-Iuliana, et autres
Publié: (2022)
par: Georgescu, Mariana-Iuliana, et autres
Publié: (2022)
VABench: A Comprehensive Benchmark for Audio-Video Generation
par: Hua, Daili, et autres
Publié: (2025)
par: Hua, Daili, et autres
Publié: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
par: Zhou, Yupeng, et autres
Publié: (2026)
par: Zhou, Yupeng, et autres
Publié: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
Semantics-Aware Human Motion Generation from Audio Instructions
par: Wang, Zi-An, et autres
Publié: (2025)
par: Wang, Zi-An, et autres
Publié: (2025)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
par: Goncalves, Lucas, et autres
Publié: (2024)
par: Goncalves, Lucas, et autres
Publié: (2024)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
TRACE: Training-Free Partial Audio Deepfake Detection via Embedding Trajectory Analysis of Speech Foundation Models
par: Khan, Awais, et autres
Publié: (2026)
par: Khan, Awais, et autres
Publié: (2026)
Hierarchical Codec Diffusion for Video-to-Speech Generation
par: Ye, Jiaxin, et autres
Publié: (2026)
par: Ye, Jiaxin, et autres
Publié: (2026)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
par: Araujo, Edson, et autres
Publié: (2025)
par: Araujo, Edson, et autres
Publié: (2025)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
par: Zeng, Donghuo, et autres
Publié: (2026)
par: Zeng, Donghuo, et autres
Publié: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)
par: Bai, Detao, et autres
Publié: (2025)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
par: Sun, Changchang, et autres
Publié: (2025)
par: Sun, Changchang, et autres
Publié: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
Documents similaires
-
Speech motion anomaly detection via cross-modal translation of 4D motion fields from tagged MRI
par: Liu, Xiaofeng, et autres
Publié: (2024) -
Semi-Supervised Bone Marrow Lesion Detection from Knee MRI Segmentation Using Mask Inpainting Models
par: Qin, Shihua, et autres
Publié: (2024) -
SIREM: Speech-Informed MRI Reconstruction with Learned Sampling
par: Hasan, Md, et autres
Publié: (2026) -
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026) -
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
par: Ton, Tri, et autres
Publié: (2025)