Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Delong, Xie, Yuexiang, Li, Yaliang, Shen, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
di: Luo, Wen, et al.
Pubblicazione: (2024)
di: Luo, Wen, et al.
Pubblicazione: (2024)
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
di: Shen, Meng, et al.
Pubblicazione: (2024)
di: Shen, Meng, et al.
Pubblicazione: (2024)
PTA: Enhancing Multimodal Sentiment Analysis through Pipelined Prediction and Translation-based Alignment
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
di: Ding, Muhe, et al.
Pubblicazione: (2024)
di: Ding, Muhe, et al.
Pubblicazione: (2024)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
di: Zheng, Xinhan, et al.
Pubblicazione: (2025)
di: Zheng, Xinhan, et al.
Pubblicazione: (2025)
Modeling Human Responses to Multimodal AI Content
di: Shen, Zhiqi, et al.
Pubblicazione: (2025)
di: Shen, Zhiqi, et al.
Pubblicazione: (2025)
Semantic Item Graph Enhancement for Multimodal Recommendation
di: Zhang, Xiaoxiong, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoxiong, et al.
Pubblicazione: (2025)
PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis
di: Xie, Heng, et al.
Pubblicazione: (2025)
di: Xie, Heng, et al.
Pubblicazione: (2025)
M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction
di: Lu, Jiacheng, et al.
Pubblicazione: (2024)
di: Lu, Jiacheng, et al.
Pubblicazione: (2024)
Differential Multimodal Transformers
di: Li, Jerry, et al.
Pubblicazione: (2025)
di: Li, Jerry, et al.
Pubblicazione: (2025)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
di: Li, Qifei, et al.
Pubblicazione: (2024)
di: Li, Qifei, et al.
Pubblicazione: (2024)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
di: Luo, Pengfei, et al.
Pubblicazione: (2025)
di: Luo, Pengfei, et al.
Pubblicazione: (2025)
CPCLDETECTOR: Knowledge Enhancement and Alignment Selection for Chinese Patronizing and Condescending Language Detection
di: Yang, Jiaxun, et al.
Pubblicazione: (2025)
di: Yang, Jiaxun, et al.
Pubblicazione: (2025)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
di: Tan, Rui Yang, et al.
Pubblicazione: (2026)
di: Tan, Rui Yang, et al.
Pubblicazione: (2026)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
di: Ju, Yeong-Joon, et al.
Pubblicazione: (2024)
di: Ju, Yeong-Joon, et al.
Pubblicazione: (2024)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
di: Kumar, Puneet, et al.
Pubblicazione: (2024)
di: Kumar, Puneet, et al.
Pubblicazione: (2024)
REMOTE: A Unified Multimodal Relation Extraction Framework with Multilevel Optimal Transport and Mixture-of-Experts
di: Lin, Xinkui, et al.
Pubblicazione: (2025)
di: Lin, Xinkui, et al.
Pubblicazione: (2025)
WorldGPT: Empowering LLM as Multimodal World Model
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
di: Li, Lin, et al.
Pubblicazione: (2024)
di: Li, Lin, et al.
Pubblicazione: (2024)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
di: Wu, Yihang, et al.
Pubblicazione: (2024)
di: Wu, Yihang, et al.
Pubblicazione: (2024)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
di: Lin, Zixing, et al.
Pubblicazione: (2026)
di: Lin, Zixing, et al.
Pubblicazione: (2026)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
di: Ge, Shiping, et al.
Pubblicazione: (2024)
di: Ge, Shiping, et al.
Pubblicazione: (2024)
Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
di: Wang, Xiaohan, et al.
Pubblicazione: (2026)
di: Wang, Xiaohan, et al.
Pubblicazione: (2026)
GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
di: Cheng, Fenghua, et al.
Pubblicazione: (2025)
di: Cheng, Fenghua, et al.
Pubblicazione: (2025)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
Enhancing Multimodal Affective Analysis with Learned Live Comment Features
di: Deng, Zhaoyuan, et al.
Pubblicazione: (2024)
di: Deng, Zhaoyuan, et al.
Pubblicazione: (2024)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
di: Xu, Danni, et al.
Pubblicazione: (2026)
di: Xu, Danni, et al.
Pubblicazione: (2026)
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition by Fusing Video Semantic in MOOC Learning Scenarios
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
HiQuE: Hierarchical Question Embedding Network for Multimodal Depression Detection
di: Jung, Juho, et al.
Pubblicazione: (2024)
di: Jung, Juho, et al.
Pubblicazione: (2024)
Has Multimodal Learning Delivered Universal Intelligence in Healthcare? A Comprehensive Survey
di: Lin, Qika, et al.
Pubblicazione: (2024)
di: Lin, Qika, et al.
Pubblicazione: (2024)
SEER: Semantic Enhancement and Emotional Reasoning Network for Multimodal Fake News Detection
di: Zhu, Peican, et al.
Pubblicazione: (2025)
di: Zhu, Peican, et al.
Pubblicazione: (2025)
KEN: Knowledge Augmentation and Emotion Guidance Network for Multimodal Fake News Detection
di: Zhu, Peican, et al.
Pubblicazione: (2025)
di: Zhu, Peican, et al.
Pubblicazione: (2025)
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
di: Jia, Yanhao, et al.
Pubblicazione: (2025)
di: Jia, Yanhao, et al.
Pubblicazione: (2025)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
di: Lin, Yuxiang, et al.
Pubblicazione: (2025)
di: Lin, Yuxiang, et al.
Pubblicazione: (2025)
OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition
di: Yan, Xueming, et al.
Pubblicazione: (2025)
di: Yan, Xueming, et al.
Pubblicazione: (2025)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
SynthGuard: An Open Platform for Detecting AI-Generated Multimedia with Multimodal LLMs
di: Desai, Shail, et al.
Pubblicazione: (2025)
di: Desai, Shail, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
di: Luo, Wen, et al.
Pubblicazione: (2024) -
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
di: Shen, Meng, et al.
Pubblicazione: (2024) -
PTA: Enhancing Multimodal Sentiment Analysis through Pipelined Prediction and Translation-based Alignment
di: Song, Shezheng, et al.
Pubblicazione: (2024) -
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
di: Ding, Muhe, et al.
Pubblicazione: (2024) -
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
di: Zheng, Xinhan, et al.
Pubblicazione: (2025)