VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Rui, Jiang, Ziyan, Liu, Ye, Su, Mingyi, Yang, Xinyi, Fu, Yuepeng, Qin, Can, Chen, Zeyuan, Xu, Ran, Xiong, Caiming, Zhou, Yingbo, Chen, Wenhu, Yavuz, Semih |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
Parameter-Efficient Detoxification with Contrastive Decoding
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
di: Liu, Ye, et al.
Pubblicazione: (2023)
di: Liu, Ye, et al.
Pubblicazione: (2023)
Retrofitting Small Multilingual Models for Retrieval: Matching 7B Performance with 300M Parameters
di: Tu, Lifu, et al.
Pubblicazione: (2025)
di: Tu, Lifu, et al.
Pubblicazione: (2025)
Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing
di: Aimar, Emanuel Sánchez, et al.
Pubblicazione: (2025)
di: Aimar, Emanuel Sánchez, et al.
Pubblicazione: (2025)
Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch Mining
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2025)
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2025)
HIVE: Harnessing Human Feedback for Instructional Visual Editing
di: Zhang, Shu, et al.
Pubblicazione: (2023)
di: Zhang, Shu, et al.
Pubblicazione: (2023)
Chart2Vec: A Universal Embedding of Context-Aware Visualizations
di: Chen, Qing, et al.
Pubblicazione: (2023)
di: Chen, Qing, et al.
Pubblicazione: (2023)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown
di: Tu, Lifu, et al.
Pubblicazione: (2024)
di: Tu, Lifu, et al.
Pubblicazione: (2024)
Trust but Verify: Programmatic VLM Evaluation in the Wild
di: Prabhu, Viraj, et al.
Pubblicazione: (2024)
di: Prabhu, Viraj, et al.
Pubblicazione: (2024)
SSR: Socratic Self-Refine for Large Language Model Reasoning
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
Traffic Light or Light Traffic? Investigating Phrasal Semantics in Large Language Models
di: Meng, Rui, et al.
Pubblicazione: (2024)
di: Meng, Rui, et al.
Pubblicazione: (2024)
ABC: Achieving Better Control of Multimodal Embeddings using VLMs
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
di: Yu, Ning, et al.
Pubblicazione: (2022)
di: Yu, Ning, et al.
Pubblicazione: (2022)
Gram2Vec: An Interpretable Document Vectorizer
di: Zeng, Peter, et al.
Pubblicazione: (2024)
di: Zeng, Peter, et al.
Pubblicazione: (2024)
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
di: Qin, Can, et al.
Pubblicazione: (2024)
di: Qin, Can, et al.
Pubblicazione: (2024)
ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
SimVecVis: A Dataset for Enhancing MLLMs in Visualization Understanding
di: Liu, Can, et al.
Pubblicazione: (2025)
di: Liu, Can, et al.
Pubblicazione: (2025)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
Vec2Summ: Text Summarization via Probabilistic Sentence Embeddings
di: Li, Mao, et al.
Pubblicazione: (2025)
di: Li, Mao, et al.
Pubblicazione: (2025)
Demo2Vec: Learning Region Embedding with Demographic Information
di: Wen, Ya, et al.
Pubblicazione: (2024)
di: Wen, Ya, et al.
Pubblicazione: (2024)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
di: Ren, Weiming, et al.
Pubblicazione: (2024)
di: Ren, Weiming, et al.
Pubblicazione: (2024)
LLM2Vec-Gen: Generative Embeddings from Large Language Models
di: BehnamGhader, Parishad, et al.
Pubblicazione: (2026)
di: BehnamGhader, Parishad, et al.
Pubblicazione: (2026)
Claim2Vec: Embedding Fact-Check Claims for Multilingual Similarity and Clustering
di: Panchendrarajan, Rrubaa, et al.
Pubblicazione: (2026)
di: Panchendrarajan, Rrubaa, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Modeling Uncertainty and Using Post-fusion as Fallback Improves Retrieval Augmented Generation with LLMs
di: Liu, Ye, et al.
Pubblicazione: (2023)
di: Liu, Ye, et al.
Pubblicazione: (2023)
Spoken Word2Vec: Learning Skipgram Embeddings from Speech
di: Sayeed, Mohammad Amaan, et al.
Pubblicazione: (2023)
di: Sayeed, Mohammad Amaan, et al.
Pubblicazione: (2023)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
di: Li, Jierui, et al.
Pubblicazione: (2024)
di: Li, Jierui, et al.
Pubblicazione: (2024)
Soft Tail-dropping for Adaptive Visual Tokenization
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
xVLM2Vec: Adapting LVLM-based embedding models to multilinguality using Self-Knowledge Distillation
di: Musacchio, Elio, et al.
Pubblicazione: (2025)
di: Musacchio, Elio, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
di: Jiang, Ziyan, et al.
Pubblicazione: (2024) -
Parameter-Efficient Detoxification with Contrastive Decoding
di: Niu, Tong, et al.
Pubblicazione: (2024) -
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
di: Peng, Xiangyu, et al.
Pubblicazione: (2025) -
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024) -
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
di: Liu, Ye, et al.
Pubblicazione: (2023)