XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Zhihua, Tao, Shumei, Wang, Junxu, He, Liang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Shared Multi-modal Embedding Space for Face-Voice Association
por: Simic, Christopher, et al.
Publicado: (2025)
por: Simic, Christopher, et al.
Publicado: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025)
por: Kang, Fang, et al.
Publicado: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026)
por: Yang, Jianxuan, et al.
Publicado: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
por: Tang, Changli, et al.
Publicado: (2025)
por: Tang, Changli, et al.
Publicado: (2025)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026)
por: Rinaldi, Ivan, et al.
Publicado: (2026)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
por: Chen, Tianle, et al.
Publicado: (2026)
por: Chen, Tianle, et al.
Publicado: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025)
por: Zhang, Zeliang, et al.
Publicado: (2025)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
por: Cheng, Xize, et al.
Publicado: (2024)
por: Cheng, Xize, et al.
Publicado: (2024)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
por: Nguyen, Ngoc-Son, et al.
Publicado: (2026)
por: Nguyen, Ngoc-Son, et al.
Publicado: (2026)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
por: Qian, Xinyuan, et al.
Publicado: (2026)
por: Qian, Xinyuan, et al.
Publicado: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
por: Yang, Kang, et al.
Publicado: (2025)
por: Yang, Kang, et al.
Publicado: (2025)
TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation
por: Liu, Xinran, et al.
Publicado: (2026)
por: Liu, Xinran, et al.
Publicado: (2026)
Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan
por: Saeed, Muhammad Saad, et al.
Publicado: (2024)
por: Saeed, Muhammad Saad, et al.
Publicado: (2024)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
por: Chu, Xuangeng, et al.
Publicado: (2025)
por: Chu, Xuangeng, et al.
Publicado: (2025)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
por: Haliassos, Alexandros, et al.
Publicado: (2026)
por: Haliassos, Alexandros, et al.
Publicado: (2026)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars
por: Zhan, Xiaoyu, et al.
Publicado: (2026)
por: Zhan, Xiaoyu, et al.
Publicado: (2026)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
por: Praveen, R. Gnana, et al.
Publicado: (2024)
por: Praveen, R. Gnana, et al.
Publicado: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
por: Saleh, Mohamed, et al.
Publicado: (2026)
por: Saleh, Mohamed, et al.
Publicado: (2026)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
RLBind: Adversarial-Invariant Cross-Modal Alignment for Unified Robust Embeddings
por: Lu, Yuhong
Publicado: (2025)
por: Lu, Yuhong
Publicado: (2025)
Emotional Face-to-Speech
por: Ye, Jiaxin, et al.
Publicado: (2025)
por: Ye, Jiaxin, et al.
Publicado: (2025)
Hear Your Face: Face-based voice conversion with F0 estimation
por: Lee, Jaejun, et al.
Publicado: (2024)
por: Lee, Jaejun, et al.
Publicado: (2024)
Voice Pathology Detection Using Phonation
por: Siva, Sri Raksha, et al.
Publicado: (2025)
por: Siva, Sri Raksha, et al.
Publicado: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization
por: Liu, Binjie, et al.
Publicado: (2025)
por: Liu, Binjie, et al.
Publicado: (2025)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
por: Rong, Yan, et al.
Publicado: (2024)
por: Rong, Yan, et al.
Publicado: (2024)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
por: Cheng, Hao, et al.
Publicado: (2025)
por: Cheng, Hao, et al.
Publicado: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
por: Liu, Tengfei, et al.
Publicado: (2026)
por: Liu, Tengfei, et al.
Publicado: (2026)
Ejemplares similares
-
Shared Multi-modal Embedding Space for Face-Voice Association
por: Simic, Christopher, et al.
Publicado: (2025) -
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025) -
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026) -
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
por: Tang, Changli, et al.
Publicado: (2025) -
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026)