Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Chong, He, Liqiang, Su, Dan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual Associated Encoder for Face Restoration
di: Tsai, Yu-Ju, et al.
Pubblicazione: (2023)
di: Tsai, Yu-Ju, et al.
Pubblicazione: (2023)
Improving OOD Generalization of Pre-trained Encoders via Aligned Embedding-Space Ensembles
di: Peng, Shuman, et al.
Pubblicazione: (2024)
di: Peng, Shuman, et al.
Pubblicazione: (2024)
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
di: Fang, Zhihua, et al.
Pubblicazione: (2025)
di: Fang, Zhihua, et al.
Pubblicazione: (2025)
RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice Association
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Face-Voice Association with Inductive Bias for Maximum Class Separation
di: Moscati, Marta, et al.
Pubblicazione: (2026)
di: Moscati, Marta, et al.
Pubblicazione: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
di: Chen, Bowei, et al.
Pubblicazione: (2025)
di: Chen, Bowei, et al.
Pubblicazione: (2025)
Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice
di: Bohy, Hugo, et al.
Pubblicazione: (2025)
di: Bohy, Hugo, et al.
Pubblicazione: (2025)
Aligning First, Then Fusing: A Novel Weakly Supervised Multimodal Violence Detection Method
di: Jin, Wenping, et al.
Pubblicazione: (2025)
di: Jin, Wenping, et al.
Pubblicazione: (2025)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
di: Tang, Feilong, et al.
Pubblicazione: (2026)
di: Tang, Feilong, et al.
Pubblicazione: (2026)
Shared Multi-modal Embedding Space for Face-Voice Association
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
Categorical Knowledge Fused Recognition: Fusing Hierarchical Knowledge with Image Classification through Aligning and Deep Metric Learning
di: Zhao, Yunfeng, et al.
Pubblicazione: (2024)
di: Zhao, Yunfeng, et al.
Pubblicazione: (2024)
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
di: Chen, Qiuhui, et al.
Pubblicazione: (2024)
di: Chen, Qiuhui, et al.
Pubblicazione: (2024)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer
di: Karim, Rezaul, et al.
Pubblicazione: (2023)
di: Karim, Rezaul, et al.
Pubblicazione: (2023)
Towards Improved Proxy-based Deep Metric Learning via Data-Augmented Domain Adaptation
di: Ren, Li, et al.
Pubblicazione: (2024)
di: Ren, Li, et al.
Pubblicazione: (2024)
A Shared Encoder Approach to Multimodal Representation Learning
di: Roy, Shuvendu, et al.
Pubblicazione: (2025)
di: Roy, Shuvendu, et al.
Pubblicazione: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
Improving Multimodal Learning via Imbalanced Learning
di: Wei, Shicai, et al.
Pubblicazione: (2025)
di: Wei, Shicai, et al.
Pubblicazione: (2025)
Imperceptible Face Forgery Attack via Adversarial Semantic Mask
di: Liu, Decheng, et al.
Pubblicazione: (2024)
di: Liu, Decheng, et al.
Pubblicazione: (2024)
Exploring Robust Face-Voice Matching in Multilingual Environments
di: Tang, Jiehui, et al.
Pubblicazione: (2024)
di: Tang, Jiehui, et al.
Pubblicazione: (2024)
Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback
di: Konovalova, Nina, et al.
Pubblicazione: (2025)
di: Konovalova, Nina, et al.
Pubblicazione: (2025)
PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Align-cDAE: Alzheimer's Disease Progression Modeling with Attention-Aligned Conditional Diffusion Auto-Encoder
di: Das, Ayantika, et al.
Pubblicazione: (2026)
di: Das, Ayantika, et al.
Pubblicazione: (2026)
Unified Multimodal Models as Auto-Encoders
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models
di: He, Xinan, et al.
Pubblicazione: (2025)
di: He, Xinan, et al.
Pubblicazione: (2025)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
Improve Contrastive Clustering Performance by Multiple Fusing-Augmenting ViT Blocks
di: Wang, Cheng, et al.
Pubblicazione: (2025)
di: Wang, Cheng, et al.
Pubblicazione: (2025)
Robust Multimodal Survival Prediction with the Latent Differentiation Conditional Variational AutoEncoder
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding
di: Li, Chong, et al.
Pubblicazione: (2025)
di: Li, Chong, et al.
Pubblicazione: (2025)
Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models
di: Bennett, Liam, et al.
Pubblicazione: (2025)
di: Bennett, Liam, et al.
Pubblicazione: (2025)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
di: Narayan, Kartik, et al.
Pubblicazione: (2025)
di: Narayan, Kartik, et al.
Pubblicazione: (2025)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
di: Song, Yehun, et al.
Pubblicazione: (2025)
di: Song, Yehun, et al.
Pubblicazione: (2025)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
di: Tang, Tao, et al.
Pubblicazione: (2024)
di: Tang, Tao, et al.
Pubblicazione: (2024)
Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction
di: Quetin, Sébastien, et al.
Pubblicazione: (2025)
di: Quetin, Sébastien, et al.
Pubblicazione: (2025)
Counterfactual Explanations for Face Forgery Detection via Adversarial Removal of Artifacts
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
MaeFuse: Transferring Omni Features with Pretrained Masked Autoencoders for Infrared and Visible Image Fusion via Guided Training
di: Li, Jiayang, et al.
Pubblicazione: (2024)
di: Li, Jiayang, et al.
Pubblicazione: (2024)
Project-and-Fuse: Improving RGB-D Semantic Segmentation via Graph Convolution Networks
di: Jiang, Xiaoyan, et al.
Pubblicazione: (2025)
di: Jiang, Xiaoyan, et al.
Pubblicazione: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
3D Face Reconstruction Using A Spectral-Based Graph Convolution Encoder
di: Xu, Haoxin, et al.
Pubblicazione: (2024)
di: Xu, Haoxin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dual Associated Encoder for Face Restoration
di: Tsai, Yu-Ju, et al.
Pubblicazione: (2023) -
Improving OOD Generalization of Pre-trained Encoders via Aligned Embedding-Space Ensembles
di: Peng, Shuman, et al.
Pubblicazione: (2024) -
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
di: Fang, Zhihua, et al.
Pubblicazione: (2025) -
RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice Association
di: Hannan, Abdul, et al.
Pubblicazione: (2025) -
Face-Voice Association with Inductive Bias for Maximum Class Separation
di: Moscati, Marta, et al.
Pubblicazione: (2026)