GME: Improving Universal Multimodal Retrieval by Multimodal LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Xin, Zhang, Yanzhao, Xie, Wen, Li, Mingxin, Dai, Ziqi, Long, Dingkun, Xie, Pengjun, Zhang, Meishan, Li, Wenjie, Zhang, Min |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
by: Dai, Ziqi, et al.
Published: (2025)
by: Dai, Ziqi, et al.
Published: (2025)
Towards Text-Image Interleaved Retrieval
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
by: Guo, Zhuoning, et al.
Published: (2025)
by: Guo, Zhuoning, et al.
Published: (2025)
mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval
by: Zhang, Xin, et al.
Published: (2024)
by: Zhang, Xin, et al.
Published: (2024)
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
by: Jin, Jiajie, et al.
Published: (2026)
by: Jin, Jiajie, et al.
Published: (2026)
ERank: Fusing Supervised Fine-Tuning and Reinforcement Learning for Effective and Efficient Text Reranking
by: Cai, Yuzheng, et al.
Published: (2025)
by: Cai, Yuzheng, et al.
Published: (2025)
E2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise Reranker
by: Liu, Qi, et al.
Published: (2025)
by: Liu, Qi, et al.
Published: (2025)
A Two-Stage Adaptation of Large Language Models for Text Ranking
by: Zhang, Longhui, et al.
Published: (2023)
by: Zhang, Longhui, et al.
Published: (2023)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
by: Song, Tingyu, et al.
Published: (2026)
by: Song, Tingyu, et al.
Published: (2026)
DiffuRank: Effective Document Reranking with Diffusion Language Models
by: Liu, Qi, et al.
Published: (2026)
by: Liu, Qi, et al.
Published: (2026)
When Text Embedding Meets Large Language Model: A Comprehensive Survey
by: Nie, Zhijie, et al.
Published: (2024)
by: Nie, Zhijie, et al.
Published: (2024)
Language Models are Universal Embedders
by: Zhang, Xin, et al.
Published: (2023)
by: Zhang, Xin, et al.
Published: (2023)
Text2Token: Unsupervised Text Representation Learning with Token Target Prediction
by: An, Ruize, et al.
Published: (2025)
by: An, Ruize, et al.
Published: (2025)
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
by: Zhang, Longhui, et al.
Published: (2024)
by: Zhang, Longhui, et al.
Published: (2024)
Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging
by: Li, Mingxin, et al.
Published: (2024)
by: Li, Mingxin, et al.
Published: (2024)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
by: Chen, Huiyao, et al.
Published: (2025)
by: Chen, Huiyao, et al.
Published: (2025)
MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering
by: Zhu, Zhengyuan, et al.
Published: (2024)
by: Zhu, Zhengyuan, et al.
Published: (2024)
An End-to-End Model for Photo-Sharing Multi-modal Dialogue Generation
by: Guo, Peiming, et al.
Published: (2024)
by: Guo, Peiming, et al.
Published: (2024)
Exploring Training and Inference Scaling Laws in Generative Retrieval
by: Cai, Hongru, et al.
Published: (2025)
by: Cai, Hongru, et al.
Published: (2025)
Structurally Refined Graph Transformer for Multimodal Recommendation
by: Shi, Ke, et al.
Published: (2025)
by: Shi, Ke, et al.
Published: (2025)
AutoSurvey: Large Language Models Can Automatically Write Surveys
by: Wang, Yidong, et al.
Published: (2024)
by: Wang, Yidong, et al.
Published: (2024)
Distillation Enhanced Generative Retrieval
by: Li, Yongqi, et al.
Published: (2024)
by: Li, Yongqi, et al.
Published: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
by: Lin, Sheng-Chieh, et al.
Published: (2024)
by: Lin, Sheng-Chieh, et al.
Published: (2024)
Unsupervised Query Routing for Retrieval Augmented Generation
by: Mu, Feiteng, et al.
Published: (2025)
by: Mu, Feiteng, et al.
Published: (2025)
OASIS: Order-Augmented Strategy for Improved Code Search
by: Gao, Zuchen, et al.
Published: (2025)
by: Gao, Zuchen, et al.
Published: (2025)
FlexRAG: A Flexible and Comprehensive Framework for Retrieval-Augmented Generation
by: Zhang, Zhuocheng, et al.
Published: (2025)
by: Zhang, Zhuocheng, et al.
Published: (2025)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
by: Wu, Hui, et al.
Published: (2026)
by: Wu, Hui, et al.
Published: (2026)
Unveiling the Magic: Investigating Attention Distillation in Retrieval-augmented Generation
by: Li, Zizhong, et al.
Published: (2024)
by: Li, Zizhong, et al.
Published: (2024)
DeTriever: Decoder-representation-based Retriever for Improving NL2SQL In-Context Learning
by: Feng, Yuxi, et al.
Published: (2024)
by: Feng, Yuxi, et al.
Published: (2024)
RaFe: Ranking Feedback Improves Query Rewriting for RAG
by: Mao, Shengyu, et al.
Published: (2024)
by: Mao, Shengyu, et al.
Published: (2024)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
by: Li, Yongqi, et al.
Published: (2024)
by: Li, Yongqi, et al.
Published: (2024)
LevelRAG: Enhancing Retrieval-Augmented Generation with Multi-hop Logic Planning over Rewriting Augmented Searchers
by: Zhang, Zhuocheng, et al.
Published: (2025)
by: Zhang, Zhuocheng, et al.
Published: (2025)
Retrieval over Classification: Integrating Relation Semantics for Multimodal Relation Extraction
by: Hei, Lei, et al.
Published: (2025)
by: Hei, Lei, et al.
Published: (2025)
Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
by: Dong, Kuicai, et al.
Published: (2025)
by: Dong, Kuicai, et al.
Published: (2025)
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
by: Yan, Yibo, et al.
Published: (2026)
by: Yan, Yibo, et al.
Published: (2026)
Progressive Multimodal Reasoning via Active Retrieval
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
CroPS: Improving Dense Retrieval with Cross-Perspective Positive Samples in Short-Video Search
by: Xie, Ao, et al.
Published: (2025)
by: Xie, Ao, et al.
Published: (2025)
Qilin: A Multimodal Information Retrieval Dataset with APP-level User Sessions
by: Chen, Jia, et al.
Published: (2025)
by: Chen, Jia, et al.
Published: (2025)
LegalMALR:Multi-Agent Query Understanding and LLM-Based Reranking for Chinese Statute Retrieval
by: Li, Yunhan, et al.
Published: (2026)
by: Li, Yunhan, et al.
Published: (2026)
Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness
by: Zhao, Xinran, et al.
Published: (2024)
by: Zhao, Xinran, et al.
Published: (2024)
Similar Items
-
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
by: Dai, Ziqi, et al.
Published: (2025) -
Towards Text-Image Interleaved Retrieval
by: Zhang, Xin, et al.
Published: (2025) -
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
by: Guo, Zhuoning, et al.
Published: (2025) -
mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval
by: Zhang, Xin, et al.
Published: (2024) -
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
by: Jin, Jiajie, et al.
Published: (2026)