XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Zhihua, Tao, Shumei, Wang, Junxu, He, Liang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shared Multi-modal Embedding Space for Face-Voice Association
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
di: Kang, Fang, et al.
Pubblicazione: (2025)
di: Kang, Fang, et al.
Pubblicazione: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
di: Tang, Changli, et al.
Pubblicazione: (2025)
di: Tang, Changli, et al.
Pubblicazione: (2025)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
di: Chen, Tianle, et al.
Pubblicazione: (2026)
di: Chen, Tianle, et al.
Pubblicazione: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
di: Cheng, Xize, et al.
Pubblicazione: (2024)
di: Cheng, Xize, et al.
Pubblicazione: (2024)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
di: Li, Qifei, et al.
Pubblicazione: (2024)
di: Li, Qifei, et al.
Pubblicazione: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation
di: Liu, Xinran, et al.
Pubblicazione: (2026)
di: Liu, Xinran, et al.
Pubblicazione: (2026)
Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
di: Chu, Xuangeng, et al.
Pubblicazione: (2025)
di: Chu, Xuangeng, et al.
Pubblicazione: (2025)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
di: Saleh, Mohamed, et al.
Pubblicazione: (2026)
di: Saleh, Mohamed, et al.
Pubblicazione: (2026)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
RLBind: Adversarial-Invariant Cross-Modal Alignment for Unified Robust Embeddings
di: Lu, Yuhong
Pubblicazione: (2025)
di: Lu, Yuhong
Pubblicazione: (2025)
Emotional Face-to-Speech
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
Hear Your Face: Face-based voice conversion with F0 estimation
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
Voice Pathology Detection Using Phonation
di: Siva, Sri Raksha, et al.
Pubblicazione: (2025)
di: Siva, Sri Raksha, et al.
Pubblicazione: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization
di: Liu, Binjie, et al.
Pubblicazione: (2025)
di: Liu, Binjie, et al.
Pubblicazione: (2025)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
di: Rong, Yan, et al.
Pubblicazione: (2024)
di: Rong, Yan, et al.
Pubblicazione: (2024)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
di: Liu, Tengfei, et al.
Pubblicazione: (2026)
di: Liu, Tengfei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Shared Multi-modal Embedding Space for Face-Voice Association
di: Simic, Christopher, et al.
Pubblicazione: (2025) -
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
di: Kang, Fang, et al.
Pubblicazione: (2025) -
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026) -
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
di: Tang, Changli, et al.
Pubblicazione: (2025) -
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)