Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Chong, He, Liqiang, Su, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dual Associated Encoder for Face Restoration
par: Tsai, Yu-Ju, et autres
Publié: (2023)
par: Tsai, Yu-Ju, et autres
Publié: (2023)
Improving OOD Generalization of Pre-trained Encoders via Aligned Embedding-Space Ensembles
par: Peng, Shuman, et autres
Publié: (2024)
par: Peng, Shuman, et autres
Publié: (2024)
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
par: Fang, Zhihua, et autres
Publié: (2025)
par: Fang, Zhihua, et autres
Publié: (2025)
RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice Association
par: Hannan, Abdul, et autres
Publié: (2025)
par: Hannan, Abdul, et autres
Publié: (2025)
Face-Voice Association with Inductive Bias for Maximum Class Separation
par: Moscati, Marta, et autres
Publié: (2026)
par: Moscati, Marta, et autres
Publié: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
par: Chen, Bowei, et autres
Publié: (2025)
par: Chen, Bowei, et autres
Publié: (2025)
Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice
par: Bohy, Hugo, et autres
Publié: (2025)
par: Bohy, Hugo, et autres
Publié: (2025)
Aligning First, Then Fusing: A Novel Weakly Supervised Multimodal Violence Detection Method
par: Jin, Wenping, et autres
Publié: (2025)
par: Jin, Wenping, et autres
Publié: (2025)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
par: Tang, Feilong, et autres
Publié: (2026)
par: Tang, Feilong, et autres
Publié: (2026)
Shared Multi-modal Embedding Space for Face-Voice Association
par: Simic, Christopher, et autres
Publié: (2025)
par: Simic, Christopher, et autres
Publié: (2025)
Categorical Knowledge Fused Recognition: Fusing Hierarchical Knowledge with Image Classification through Aligning and Deep Metric Learning
par: Zhao, Yunfeng, et autres
Publié: (2024)
par: Zhao, Yunfeng, et autres
Publié: (2024)
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
par: Chen, Qiuhui, et autres
Publié: (2024)
par: Chen, Qiuhui, et autres
Publié: (2024)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer
par: Karim, Rezaul, et autres
Publié: (2023)
par: Karim, Rezaul, et autres
Publié: (2023)
Towards Improved Proxy-based Deep Metric Learning via Data-Augmented Domain Adaptation
par: Ren, Li, et autres
Publié: (2024)
par: Ren, Li, et autres
Publié: (2024)
A Shared Encoder Approach to Multimodal Representation Learning
par: Roy, Shuvendu, et autres
Publié: (2025)
par: Roy, Shuvendu, et autres
Publié: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
Improving Multimodal Learning via Imbalanced Learning
par: Wei, Shicai, et autres
Publié: (2025)
par: Wei, Shicai, et autres
Publié: (2025)
Imperceptible Face Forgery Attack via Adversarial Semantic Mask
par: Liu, Decheng, et autres
Publié: (2024)
par: Liu, Decheng, et autres
Publié: (2024)
Exploring Robust Face-Voice Matching in Multilingual Environments
par: Tang, Jiehui, et autres
Publié: (2024)
par: Tang, Jiehui, et autres
Publié: (2024)
Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback
par: Konovalova, Nina, et autres
Publié: (2025)
par: Konovalova, Nina, et autres
Publié: (2025)
PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association
par: Hannan, Abdul, et autres
Publié: (2025)
par: Hannan, Abdul, et autres
Publié: (2025)
Align-cDAE: Alzheimer's Disease Progression Modeling with Attention-Aligned Conditional Diffusion Auto-Encoder
par: Das, Ayantika, et autres
Publié: (2026)
par: Das, Ayantika, et autres
Publié: (2026)
Unified Multimodal Models as Auto-Encoders
par: Yan, Zhiyuan, et autres
Publié: (2025)
par: Yan, Zhiyuan, et autres
Publié: (2025)
VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models
par: He, Xinan, et autres
Publié: (2025)
par: He, Xinan, et autres
Publié: (2025)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
par: Wu, Chengfei, et autres
Publié: (2025)
par: Wu, Chengfei, et autres
Publié: (2025)
Improve Contrastive Clustering Performance by Multiple Fusing-Augmenting ViT Blocks
par: Wang, Cheng, et autres
Publié: (2025)
par: Wang, Cheng, et autres
Publié: (2025)
Robust Multimodal Survival Prediction with the Latent Differentiation Conditional Variational AutoEncoder
par: Zhou, Junjie, et autres
Publié: (2025)
par: Zhou, Junjie, et autres
Publié: (2025)
DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding
par: Li, Chong, et autres
Publié: (2025)
par: Li, Chong, et autres
Publié: (2025)
Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models
par: Bennett, Liam, et autres
Publié: (2025)
par: Bennett, Liam, et autres
Publié: (2025)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
par: Song, Yehun, et autres
Publié: (2025)
par: Song, Yehun, et autres
Publié: (2025)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
par: Hu, Yuepeng, et autres
Publié: (2025)
par: Hu, Yuepeng, et autres
Publié: (2025)
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
par: Tang, Tao, et autres
Publié: (2024)
par: Tang, Tao, et autres
Publié: (2024)
Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction
par: Quetin, Sébastien, et autres
Publié: (2025)
par: Quetin, Sébastien, et autres
Publié: (2025)
Counterfactual Explanations for Face Forgery Detection via Adversarial Removal of Artifacts
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
MaeFuse: Transferring Omni Features with Pretrained Masked Autoencoders for Infrared and Visible Image Fusion via Guided Training
par: Li, Jiayang, et autres
Publié: (2024)
par: Li, Jiayang, et autres
Publié: (2024)
Project-and-Fuse: Improving RGB-D Semantic Segmentation via Graph Convolution Networks
par: Jiang, Xiaoyan, et autres
Publié: (2025)
par: Jiang, Xiaoyan, et autres
Publié: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
3D Face Reconstruction Using A Spectral-Based Graph Convolution Encoder
par: Xu, Haoxin, et autres
Publié: (2024)
par: Xu, Haoxin, et autres
Publié: (2024)
Documents similaires
-
Dual Associated Encoder for Face Restoration
par: Tsai, Yu-Ju, et autres
Publié: (2023) -
Improving OOD Generalization of Pre-trained Encoders via Aligned Embedding-Space Ensembles
par: Peng, Shuman, et autres
Publié: (2024) -
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
par: Fang, Zhihua, et autres
Publié: (2025) -
RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice Association
par: Hannan, Abdul, et autres
Publié: (2025) -
Face-Voice Association with Inductive Bias for Maximum Class Separation
par: Moscati, Marta, et autres
Publié: (2026)