Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Tiancheng, Yang, Kaicheng, Feng, Ziyong, Wang, Xingjun, Zhang, Yanzhao, Long, Dingkun, Chen, Yingda, Cai, Weidong, Deng, Jiankang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
RWKV-CLIP: A Robust Vision-Language Representation Learner
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024)
par: Yang, Kaicheng, et autres
Publié: (2024)
ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Multi-label Cluster Discrimination for Visual Representation Learning
par: An, Xiang, et autres
Publié: (2024)
par: An, Xiang, et autres
Publié: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
par: Guo, Zhuoning, et autres
Publié: (2025)
par: Guo, Zhuoning, et autres
Publié: (2025)
High-Fidelity Facial Albedo Estimation via Texture Quantization
par: Ran, Zimin, et autres
Publié: (2024)
par: Ran, Zimin, et autres
Publié: (2024)
PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training
par: Xie, Yin, et autres
Publié: (2025)
par: Xie, Yin, et autres
Publié: (2025)
UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Region-based Cluster Discrimination for Visual Representation Learning
par: Xie, Yin, et autres
Publié: (2025)
par: Xie, Yin, et autres
Publié: (2025)
ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
par: Xie, Yin, et autres
Publié: (2024)
par: Xie, Yin, et autres
Publié: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
par: Shen, Hengyu, et autres
Publié: (2026)
par: Shen, Hengyu, et autres
Publié: (2026)
IDAdapter: Learning Mixed Features for Tuning-Free Personalization of Text-to-Image Models
par: Cui, Siying, et autres
Publié: (2024)
par: Cui, Siying, et autres
Publié: (2024)
1st Place Solution to the 1st SkatingVerse Challenge
par: Sun, Tao, et autres
Publié: (2024)
par: Sun, Tao, et autres
Publié: (2024)
Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
par: Zheng, Tianlu, et autres
Publié: (2025)
par: Zheng, Tianlu, et autres
Publié: (2025)
Decoupled Global-Local Alignment for Improving Compositional Understanding
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets
par: Chen, Zhichao, et autres
Publié: (2026)
par: Chen, Zhichao, et autres
Publié: (2026)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
par: Tang, Feilong, et autres
Publié: (2026)
par: Tang, Feilong, et autres
Publié: (2026)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
ForCenNet: Foreground-Centric Network for Document Image Rectification
par: Cai, Peng, et autres
Publié: (2025)
par: Cai, Peng, et autres
Publié: (2025)
EliGen: Entity-Level Controlled Image Generation with Regional Attention
par: Zhang, Hong, et autres
Publié: (2025)
par: Zhang, Hong, et autres
Publié: (2025)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
par: Yang, Sicheng, et autres
Publié: (2026)
par: Yang, Sicheng, et autres
Publié: (2026)
Multimodal LLMs under Pairwise Modalities
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
par: Yang, Tiancheng, et autres
Publié: (2025)
par: Yang, Tiancheng, et autres
Publié: (2025)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
par: Zhang, Hong, et autres
Publié: (2025)
par: Zhang, Hong, et autres
Publié: (2025)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
par: Wang, Ruofan, et autres
Publié: (2025)
par: Wang, Ruofan, et autres
Publié: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
ObjEmbed: Towards Universal Multimodal Object Embeddings
par: Fu, Shenghao, et autres
Publié: (2026)
par: Fu, Shenghao, et autres
Publié: (2026)
Breaking the Discretization Barrier of Continuous Physics Simulation Learning
par: Xu, Fan, et autres
Publié: (2025)
par: Xu, Fan, et autres
Publié: (2025)
Learning Contrastive Multimodal Fusion with Improved Modality Dropout for Disease Detection and Prediction
par: Gu, Yi, et autres
Publié: (2025)
par: Gu, Yi, et autres
Publié: (2025)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
par: He, Chenwei, et autres
Publié: (2026)
par: He, Chenwei, et autres
Publié: (2026)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
Documents similaires
-
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
par: Gu, Tiancheng, et autres
Publié: (2025) -
RWKV-CLIP: A Robust Vision-Language Representation Learner
par: Gu, Tiancheng, et autres
Publié: (2024) -
RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
par: Gu, Tiancheng, et autres
Publié: (2025) -
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024) -
ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
par: Gu, Tiancheng, et autres
Publié: (2024)