Cross-Modal Coordination Across a Diverse Set of Input Modalities
Fuente:
arXiv
Guardado en:
| Autores principales: | Sánchez, Jorge, Laguna, Rodrigo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
por: Fan, Yunfeng, et al.
Publicado: (2023)
por: Fan, Yunfeng, et al.
Publicado: (2023)
MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation
por: Li, Hui, et al.
Publicado: (2025)
por: Li, Hui, et al.
Publicado: (2025)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
por: Fan, Yunfeng, et al.
Publicado: (2023)
por: Fan, Yunfeng, et al.
Publicado: (2023)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
por: Zhang, Yafei, et al.
Publicado: (2025)
por: Zhang, Yafei, et al.
Publicado: (2025)
Calibrated Multimodal Representation Learning with Missing Modalities
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction
por: Qin, Jie, et al.
Publicado: (2025)
por: Qin, Jie, et al.
Publicado: (2025)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
por: Saleh, Mohamed, et al.
Publicado: (2026)
por: Saleh, Mohamed, et al.
Publicado: (2026)
Knowledge Bridger: Towards Training-free Missing Modality Completion
por: Ke, Guanzhou, et al.
Publicado: (2025)
por: Ke, Guanzhou, et al.
Publicado: (2025)
BadCM: Invisible Backdoor Attack Against Cross-Modal Learning
por: Zhang, Zheng, et al.
Publicado: (2024)
por: Zhang, Zheng, et al.
Publicado: (2024)
MCE: Towards a General Framework for Handling Missing Modalities under Imbalanced Missing Rates
por: Zhao, Binyu, et al.
Publicado: (2025)
por: Zhao, Binyu, et al.
Publicado: (2025)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
por: Panta, Sanjeev, et al.
Publicado: (2026)
por: Panta, Sanjeev, et al.
Publicado: (2026)
COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition
por: Chen, Baiyu, et al.
Publicado: (2025)
por: Chen, Baiyu, et al.
Publicado: (2025)
HeCoFuse: Cross-Modal Complementary V2X Cooperative Perception with Heterogeneous Sensors
por: Wei, Chuheng, et al.
Publicado: (2025)
por: Wei, Chuheng, et al.
Publicado: (2025)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
por: Huang, Hailang, et al.
Publicado: (2024)
por: Huang, Hailang, et al.
Publicado: (2024)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
por: Zhong, Guowei, et al.
Publicado: (2025)
por: Zhong, Guowei, et al.
Publicado: (2025)
ReconBoost: Boosting Can Achieve Modality Reconcilement
por: Hua, Cong, et al.
Publicado: (2024)
por: Hua, Cong, et al.
Publicado: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
por: Chen, Junyi, et al.
Publicado: (2023)
por: Chen, Junyi, et al.
Publicado: (2023)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
por: Lin, Xiang, et al.
Publicado: (2025)
por: Lin, Xiang, et al.
Publicado: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
Towards Multi-Task Multi-Modal Models: A Video Generative Perspective
por: Yu, Lijun
Publicado: (2024)
por: Yu, Lijun
Publicado: (2024)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
por: Wei, Fangda, et al.
Publicado: (2026)
por: Wei, Fangda, et al.
Publicado: (2026)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
Integrating Large Language Models into a Tri-Modal Architecture for Automated Depression Classification on the DAIC-WOZ
por: Patapati, Santosh V.
Publicado: (2024)
por: Patapati, Santosh V.
Publicado: (2024)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2024)
por: Mu, Zhaoxi, et al.
Publicado: (2024)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
por: Hao, Haihong, et al.
Publicado: (2025)
por: Hao, Haihong, et al.
Publicado: (2025)
Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning
por: Singh, Nikhil, et al.
Publicado: (2023)
por: Singh, Nikhil, et al.
Publicado: (2023)
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
por: Shen, Chengchao, et al.
Publicado: (2025)
por: Shen, Chengchao, et al.
Publicado: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
por: Tong, Yijie, et al.
Publicado: (2026)
por: Tong, Yijie, et al.
Publicado: (2026)
PC$^2$: Pseudo-Classification Based Pseudo-Captioning for Noisy Correspondence Learning in Cross-Modal Retrieval
por: Duan, Yue, et al.
Publicado: (2024)
por: Duan, Yue, et al.
Publicado: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
por: Pu, Ruitao, et al.
Publicado: (2025)
por: Pu, Ruitao, et al.
Publicado: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
por: Li, Xiaoxi, et al.
Publicado: (2026)
por: Li, Xiaoxi, et al.
Publicado: (2026)
OneLLM: One Framework to Align All Modalities with Language
por: Han, Jiaming, et al.
Publicado: (2023)
por: Han, Jiaming, et al.
Publicado: (2023)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
por: Wang, Yabing, et al.
Publicado: (2023)
por: Wang, Yabing, et al.
Publicado: (2023)
Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation
por: Roy, Prasun, et al.
Publicado: (2025)
por: Roy, Prasun, et al.
Publicado: (2025)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Anisotropic Modality Align
por: Yu, Xiaomin, et al.
Publicado: (2026)
por: Yu, Xiaomin, et al.
Publicado: (2026)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
por: Miao, Bingchen, et al.
Publicado: (2024)
por: Miao, Bingchen, et al.
Publicado: (2024)
Ejemplares similares
-
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
por: Fan, Yunfeng, et al.
Publicado: (2023) -
MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation
por: Li, Hui, et al.
Publicado: (2025) -
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
por: Fan, Yunfeng, et al.
Publicado: (2023) -
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
por: Zhang, Yafei, et al.
Publicado: (2025) -
Calibrated Multimodal Representation Learning with Missing Modalities
por: Liu, Xiaohao, et al.
Publicado: (2025)