e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Haonan, Gao, Sicheng, Timofte, Radu, Sakai, Tetsuya, Dou, Zhicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
por: Chen, Haonan, et al.
Publicado: (2025)
por: Chen, Haonan, et al.
Publicado: (2025)
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
por: Chen, Haonan, et al.
Publicado: (2025)
por: Chen, Haonan, et al.
Publicado: (2025)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
por: Lei, Youbo, et al.
Publicado: (2023)
por: Lei, Youbo, et al.
Publicado: (2023)
ViT-Lens: Towards Omni-modal Representations
por: Lei, Weixian, et al.
Publicado: (2023)
por: Lei, Weixian, et al.
Publicado: (2023)
Cross-modal Information Flow in Multimodal Large Language Models
por: Zhang, Zhi, et al.
Publicado: (2024)
por: Zhang, Zhi, et al.
Publicado: (2024)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
por: Zhao, Fei, et al.
Publicado: (2024)
por: Zhao, Fei, et al.
Publicado: (2024)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
por: Shen, Li-Cheng, et al.
Publicado: (2025)
por: Shen, Li-Cheng, et al.
Publicado: (2025)
LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts
por: Jesani, Krunal, et al.
Publicado: (2025)
por: Jesani, Krunal, et al.
Publicado: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
por: Liu, Tengfei, et al.
Publicado: (2024)
por: Liu, Tengfei, et al.
Publicado: (2024)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025)
por: Zhang, Yiman, et al.
Publicado: (2025)
Instruct-Imagen: Image Generation with Multi-modal Instruction
por: Hu, Hexiang, et al.
Publicado: (2024)
por: Hu, Hexiang, et al.
Publicado: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
por: Zhang, Ming, et al.
Publicado: (2024)
por: Zhang, Ming, et al.
Publicado: (2024)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
VIMI: Grounding Video Generation through Multi-modal Instruction
por: Fang, Yuwei, et al.
Publicado: (2024)
por: Fang, Yuwei, et al.
Publicado: (2024)
Cross-modal linkage risk in clinical vision-language models
por: Arasteh, Soroosh Tayebi, et al.
Publicado: (2026)
por: Arasteh, Soroosh Tayebi, et al.
Publicado: (2026)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
OmniGAIA: Towards Native Omni-Modal AI Agents
por: Li, Xiaoxi, et al.
Publicado: (2026)
por: Li, Xiaoxi, et al.
Publicado: (2026)
AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment
por: Li, Yan, et al.
Publicado: (2024)
por: Li, Yan, et al.
Publicado: (2024)
mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation
por: Hu, Chan-Wei, et al.
Publicado: (2025)
por: Hu, Chan-Wei, et al.
Publicado: (2025)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
por: Yao, Zonghai, et al.
Publicado: (2026)
por: Yao, Zonghai, et al.
Publicado: (2026)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
por: Li, Shengzhi, et al.
Publicado: (2024)
por: Li, Shengzhi, et al.
Publicado: (2024)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
por: Zhou, Ziwei, et al.
Publicado: (2025)
por: Zhou, Ziwei, et al.
Publicado: (2025)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
por: Ji, Xingguang, et al.
Publicado: (2025)
por: Ji, Xingguang, et al.
Publicado: (2025)
MuDreamer: Learning Predictive World Models without Reconstruction
por: Burchi, Maxime, et al.
Publicado: (2024)
por: Burchi, Maxime, et al.
Publicado: (2024)
Learned Lightweight Smartphone ISP with Unpaired Data
por: Arhire, Andrei, et al.
Publicado: (2025)
por: Arhire, Andrei, et al.
Publicado: (2025)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
por: Zhu, Mengdan, et al.
Publicado: (2025)
por: Zhu, Mengdan, et al.
Publicado: (2025)
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
por: Chen, Junjie, et al.
Publicado: (2024)
por: Chen, Junjie, et al.
Publicado: (2024)
Memory-based Cross-modal Semantic Alignment Network for Radiology Report Generation
por: Tao, Yitian, et al.
Publicado: (2024)
por: Tao, Yitian, et al.
Publicado: (2024)
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024)
por: Chen, Qiguang, et al.
Publicado: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
por: Liu, Zhihang, et al.
Publicado: (2025)
por: Liu, Zhihang, et al.
Publicado: (2025)
Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing
por: Wijegunarathna, Kalana, et al.
Publicado: (2025)
por: Wijegunarathna, Kalana, et al.
Publicado: (2025)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
How Well Do Multi-modal LLMs Interpret CT Scans? An Auto-Evaluation Framework for Analyses
por: Zhu, Qingqing, et al.
Publicado: (2024)
por: Zhu, Qingqing, et al.
Publicado: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
por: Jin, Zhuoran, et al.
Publicado: (2025)
por: Jin, Zhuoran, et al.
Publicado: (2025)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
por: Li, Zhang, et al.
Publicado: (2023)
por: Li, Zhang, et al.
Publicado: (2023)
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
por: Kim, Junho, et al.
Publicado: (2024)
por: Kim, Junho, et al.
Publicado: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
por: Ohi, Masanari, et al.
Publicado: (2024)
por: Ohi, Masanari, et al.
Publicado: (2024)
Ejemplares similares
-
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
por: Chen, Haonan, et al.
Publicado: (2025) -
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
por: Zhang, Haoyu, et al.
Publicado: (2026) -
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
por: Chen, Haonan, et al.
Publicado: (2025) -
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
por: Lei, Youbo, et al.
Publicado: (2023) -
ViT-Lens: Towards Omni-modal Representations
por: Lei, Weixian, et al.
Publicado: (2023)