MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Qiyu, Cui, Shuyang, Hayakawa, Satoshi, Wang, Wei-Yao, Wakaki, Hiromi, Mitsufuji, Yuki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
por: Li, Haoxuan, et al.
Publicado: (2025)
por: Li, Haoxuan, et al.
Publicado: (2025)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
por: Wei, Tianxin, et al.
Publicado: (2024)
por: Wei, Tianxin, et al.
Publicado: (2024)
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
por: Wu, Jiaxin, et al.
Publicado: (2025)
por: Wu, Jiaxin, et al.
Publicado: (2025)
Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning
por: Nie, Zhijie, et al.
Publicado: (2024)
por: Nie, Zhijie, et al.
Publicado: (2024)
Modality-Aware Identity Construction and Counterfactual Structure Learning for ID-Free Multimodal Recommendation
por: Ma, Hongjian, et al.
Publicado: (2026)
por: Ma, Hongjian, et al.
Publicado: (2026)
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
por: Jia, Yanhao, et al.
Publicado: (2025)
por: Jia, Yanhao, et al.
Publicado: (2025)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
por: Luo, Pengfei, et al.
Publicado: (2025)
por: Luo, Pengfei, et al.
Publicado: (2025)
A Comprehensive Survey on Composed Image Retrieval
por: Song, Xuemeng, et al.
Publicado: (2025)
por: Song, Xuemeng, et al.
Publicado: (2025)
A Survey of Multimodal Composite Editing and Retrieval
por: Li, Suyan, et al.
Publicado: (2024)
por: Li, Suyan, et al.
Publicado: (2024)
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
por: Su, Taoyu, et al.
Publicado: (2025)
por: Su, Taoyu, et al.
Publicado: (2025)
Automating Steering for Safe Multimodal Large Language Models
por: Wu, Lyucheng, et al.
Publicado: (2025)
por: Wu, Lyucheng, et al.
Publicado: (2025)
CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation
por: Zhan, Hao, et al.
Publicado: (2026)
por: Zhan, Hao, et al.
Publicado: (2026)
Multimodal Learned Sparse Retrieval for Image Suggestion
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Multimodal Misinformation Detection using Large Vision-Language Models
por: Tahmasebi, Sahar, et al.
Publicado: (2024)
por: Tahmasebi, Sahar, et al.
Publicado: (2024)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
por: Wang, Tianshi, et al.
Publicado: (2023)
por: Wang, Tianshi, et al.
Publicado: (2023)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
por: Zhou, Ao, et al.
Publicado: (2025)
por: Zhou, Ao, et al.
Publicado: (2025)
Composite Sketch+Text Queries for Retrieving Objects with Elusive Names and Complex Interactions
por: Gatti, Prajwal, et al.
Publicado: (2025)
por: Gatti, Prajwal, et al.
Publicado: (2025)
Spectrum-based Modality Representation Fusion Graph Convolutional Network for Multimodal Recommendation
por: Ong, Rongqing Kenneth, et al.
Publicado: (2024)
por: Ong, Rongqing Kenneth, et al.
Publicado: (2024)
Unified Hallucination Detection for Multimodal Large Language Models
por: Chen, Xiang, et al.
Publicado: (2024)
por: Chen, Xiang, et al.
Publicado: (2024)
EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge
por: Hu, Congcong, et al.
Publicado: (2026)
por: Hu, Congcong, et al.
Publicado: (2026)
Mitigating the Impact of Reference Quality on Evaluation of Summarization Systems with Reference-Free Metrics
por: Gigant, Théo, et al.
Publicado: (2024)
por: Gigant, Théo, et al.
Publicado: (2024)
DSRAG: A Domain-Specific Retrieval Framework Based on Document-derived Multimodal Knowledge Graph
por: Yang, Mengzheng, et al.
Publicado: (2025)
por: Yang, Mengzheng, et al.
Publicado: (2025)
Unraveling Movie Genres through Cross-Attention Fusion of Bi-Modal Synergy of Poster
por: Nareti, Utsav Kumar, et al.
Publicado: (2024)
por: Nareti, Utsav Kumar, et al.
Publicado: (2024)
Semantic Item Graph Enhancement for Multimodal Recommendation
por: Zhang, Xiaoxiong, et al.
Publicado: (2025)
por: Zhang, Xiaoxiong, et al.
Publicado: (2025)
Personalized Image Generation with Large Multimodal Models
por: Xu, Yiyan, et al.
Publicado: (2024)
por: Xu, Yiyan, et al.
Publicado: (2024)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
por: Kim, Wongyu, et al.
Publicado: (2025)
por: Kim, Wongyu, et al.
Publicado: (2025)
InfoCIR: Multimedia Analysis for Composed Image Retrieval
por: Dravilas, Ioannis, et al.
Publicado: (2026)
por: Dravilas, Ioannis, et al.
Publicado: (2026)
MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Multimodal Graph Neural Network for Recommendation with Dynamic De-redundancy and Modality-Guided Feature De-noisy
por: Mo, Feng, et al.
Publicado: (2024)
por: Mo, Feng, et al.
Publicado: (2024)
PREMISE: Matching-based Prediction for Accurate Review Recommendation
por: Han, Wei, et al.
Publicado: (2025)
por: Han, Wei, et al.
Publicado: (2025)
A Multimodal Single-Branch Embedding Network for Recommendation in Cold-Start and Missing Modality Scenarios
por: Ganhör, Christian, et al.
Publicado: (2024)
por: Ganhör, Christian, et al.
Publicado: (2024)
The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval
por: Fu, Junchen, et al.
Publicado: (2026)
por: Fu, Junchen, et al.
Publicado: (2026)
REMOTE: A Unified Multimodal Relation Extraction Framework with Multilevel Optimal Transport and Mixture-of-Experts
por: Lin, Xinkui, et al.
Publicado: (2025)
por: Lin, Xinkui, et al.
Publicado: (2025)
Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling
por: Jiang, Wei, et al.
Publicado: (2026)
por: Jiang, Wei, et al.
Publicado: (2026)
Cross-Modal Retrieval with Cauchy-Schwarz Divergence
por: Zhang, Jiahao, et al.
Publicado: (2025)
por: Zhang, Jiahao, et al.
Publicado: (2025)
MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions
por: Zhang, Kai, et al.
Publicado: (2024)
por: Zhang, Kai, et al.
Publicado: (2024)
Ejemplares similares
-
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
por: Mao, Zhuoyuan, et al.
Publicado: (2025) -
Cross-Modal Learning for Music-to-Music-Video Description Generation
por: Mao, Zhuoyuan, et al.
Publicado: (2025) -
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024) -
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
por: Li, Haoxuan, et al.
Publicado: (2025) -
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
por: Wei, Tianxin, et al.
Publicado: (2024)