Multimodal RAG Enhanced Visual Description
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jaiswal, Amit Kumar, Liu, Haiming, Frommholz, Ingo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Open Multimodal Retrieval-Augmented Factual Image Generation
par: Tian, Yang, et autres
Publié: (2025)
par: Tian, Yang, et autres
Publié: (2025)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
par: Fu, Chenghan, et autres
Publié: (2025)
par: Fu, Chenghan, et autres
Publié: (2025)
Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
par: Luo, Weiqing, et autres
Publié: (2026)
par: Luo, Weiqing, et autres
Publié: (2026)
Reasoning-Augmented Representations for Multimodal Retrieval
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
par: Zhang, Daoze, et autres
Publié: (2025)
par: Zhang, Daoze, et autres
Publié: (2025)
Provenance Analysis of Archaeological Artifacts via Multimodal RAG Systems
par: Zhang, Tuo, et autres
Publié: (2025)
par: Zhang, Tuo, et autres
Publié: (2025)
GENIUS: A Generative Framework for Universal Multimodal Search
par: Kim, Sungyeon, et autres
Publié: (2025)
par: Kim, Sungyeon, et autres
Publié: (2025)
CSA: Data-efficient Mapping of Unimodal Features to Multimodal Features
par: Li, Po-han, et autres
Publié: (2024)
par: Li, Po-han, et autres
Publié: (2024)
VideoRAG: Retrieval-Augmented Generation over Video Corpus
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
par: Zhang, Zhixin, et autres
Publié: (2024)
par: Zhang, Zhixin, et autres
Publié: (2024)
Incremental Concept Formation over Visual Images Without Catastrophic Forgetting
par: Barari, Nicki, et autres
Publié: (2024)
par: Barari, Nicki, et autres
Publié: (2024)
MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding
par: Wu, Junxian, et autres
Publié: (2026)
par: Wu, Junxian, et autres
Publié: (2026)
MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
par: Nie, Zhanheng, et autres
Publié: (2025)
par: Nie, Zhanheng, et autres
Publié: (2025)
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
LookSync: Large-Scale Visual Product Search System for AI-Generated Fashion Looks
par: M, Pradeep, et autres
Publié: (2025)
par: M, Pradeep, et autres
Publié: (2025)
TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
par: Si, Jacob, et autres
Publié: (2025)
par: Si, Jacob, et autres
Publié: (2025)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
CBM-RAG: Demonstrating Enhanced Interpretability in Radiology Report Generation with Multi-Agent RAG and Concept Bottleneck Models
par: Alam, Hasan Md Tusfiqur, et autres
Publié: (2025)
par: Alam, Hasan Md Tusfiqur, et autres
Publié: (2025)
EIVEN: Efficient Implicit Attribute Value Extraction using Multimodal LLM
par: Zou, Henry Peng, et autres
Publié: (2024)
par: Zou, Henry Peng, et autres
Publié: (2024)
Taxonomic Reasoning for Rare Arthropods: Combining Dense Image Captioning and RAG for Interpretable Classification
par: Lesperance, Nathaniel, et autres
Publié: (2025)
par: Lesperance, Nathaniel, et autres
Publié: (2025)
Revisit Anything: Visual Place Recognition via Image Segment Retrieval
par: Garg, Kartik, et autres
Publié: (2024)
par: Garg, Kartik, et autres
Publié: (2024)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
par: Giahi, Ramin, et autres
Publié: (2025)
par: Giahi, Ramin, et autres
Publié: (2025)
Beyond Matryoshka: Revisiting Sparse Coding for Adaptive Representation
par: Wen, Tiansheng, et autres
Publié: (2025)
par: Wen, Tiansheng, et autres
Publié: (2025)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
par: Guo, Zhuoning, et autres
Publié: (2025)
par: Guo, Zhuoning, et autres
Publié: (2025)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
par: Zou, Henry Peng, et autres
Publié: (2024)
par: Zou, Henry Peng, et autres
Publié: (2024)
RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance
par: Mortaheb, Matin, et autres
Publié: (2025)
par: Mortaheb, Matin, et autres
Publié: (2025)
Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive Survey
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
par: Abaskohi, Amirhossein, et autres
Publié: (2024)
par: Abaskohi, Amirhossein, et autres
Publié: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
iRAG: Advancing RAG for Videos with an Incremental Approach
par: Arefeen, Md Adnan, et autres
Publié: (2024)
par: Arefeen, Md Adnan, et autres
Publié: (2024)
A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
par: Haque, Md Rezwanul, et autres
Publié: (2025)
par: Haque, Md Rezwanul, et autres
Publié: (2025)
Learning-Based Hashing for ANN Search: Foundations and Early Advances
par: Moran, Sean
Publié: (2025)
par: Moran, Sean
Publié: (2025)
Efficient Table QA via TableGrid Navigation and Progressive Inference Prompting
par: Maurya, Amritansh, et autres
Publié: (2026)
par: Maurya, Amritansh, et autres
Publié: (2026)
Attribute-Guided Multi-Level Attention Network for Fine-Grained Fashion Retrieval
par: Xiao, Ling, et autres
Publié: (2022)
par: Xiao, Ling, et autres
Publié: (2022)
FeatUp: A Model-Agnostic Framework for Features at Any Resolution
par: Fu, Stephanie, et autres
Publié: (2024)
par: Fu, Stephanie, et autres
Publié: (2024)
Data-Centric Approach to Constrained Machine Learning: A Case Study on Conway's Game of Life
par: Bibin, Anton, et autres
Publié: (2024)
par: Bibin, Anton, et autres
Publié: (2024)
Sustainable techniques to improve Data Quality for training image-based explanatory models for Recommender Systems
par: Paz-Ruza, Jorge, et autres
Publié: (2024)
par: Paz-Ruza, Jorge, et autres
Publié: (2024)
Character-based Outfit Generation with Vision-augmented Style Extraction via LLMs
par: Forouzandehmehr, Najmeh, et autres
Publié: (2024)
par: Forouzandehmehr, Najmeh, et autres
Publié: (2024)
Documents similaires
-
Open Multimodal Retrieval-Augmented Factual Image Generation
par: Tian, Yang, et autres
Publié: (2025) -
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
par: Fu, Chenghan, et autres
Publié: (2025) -
Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
par: Mannam, Varun, et autres
Publié: (2025) -
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
par: Luo, Weiqing, et autres
Publié: (2026) -
Reasoning-Augmented Representations for Multimodal Retrieval
par: Zhang, Jianrui, et autres
Publié: (2026)