Multimodal RAG Enhanced Visual Description
Fuente:
arXiv
Salvato in:
| Autori principali: | Jaiswal, Amit Kumar, Liu, Haiming, Frommholz, Ingo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Open Multimodal Retrieval-Augmented Factual Image Generation
di: Tian, Yang, et al.
Pubblicazione: (2025)
di: Tian, Yang, et al.
Pubblicazione: (2025)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
di: Fu, Chenghan, et al.
Pubblicazione: (2025)
di: Fu, Chenghan, et al.
Pubblicazione: (2025)
Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
di: Mannam, Varun, et al.
Pubblicazione: (2025)
di: Mannam, Varun, et al.
Pubblicazione: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
Reasoning-Augmented Representations for Multimodal Retrieval
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
di: Zhang, Daoze, et al.
Pubblicazione: (2025)
di: Zhang, Daoze, et al.
Pubblicazione: (2025)
Provenance Analysis of Archaeological Artifacts via Multimodal RAG Systems
di: Zhang, Tuo, et al.
Pubblicazione: (2025)
di: Zhang, Tuo, et al.
Pubblicazione: (2025)
GENIUS: A Generative Framework for Universal Multimodal Search
di: Kim, Sungyeon, et al.
Pubblicazione: (2025)
di: Kim, Sungyeon, et al.
Pubblicazione: (2025)
CSA: Data-efficient Mapping of Unimodal Features to Multimodal Features
di: Li, Po-han, et al.
Pubblicazione: (2024)
di: Li, Po-han, et al.
Pubblicazione: (2024)
VideoRAG: Retrieval-Augmented Generation over Video Corpus
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
di: Zhang, Zhixin, et al.
Pubblicazione: (2024)
di: Zhang, Zhixin, et al.
Pubblicazione: (2024)
Incremental Concept Formation over Visual Images Without Catastrophic Forgetting
di: Barari, Nicki, et al.
Pubblicazione: (2024)
di: Barari, Nicki, et al.
Pubblicazione: (2024)
MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding
di: Wu, Junxian, et al.
Pubblicazione: (2026)
di: Wu, Junxian, et al.
Pubblicazione: (2026)
MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
di: Nie, Zhanheng, et al.
Pubblicazione: (2025)
di: Nie, Zhanheng, et al.
Pubblicazione: (2025)
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
LookSync: Large-Scale Visual Product Search System for AI-Generated Fashion Looks
di: M, Pradeep, et al.
Pubblicazione: (2025)
di: M, Pradeep, et al.
Pubblicazione: (2025)
TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
di: Si, Jacob, et al.
Pubblicazione: (2025)
di: Si, Jacob, et al.
Pubblicazione: (2025)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
CBM-RAG: Demonstrating Enhanced Interpretability in Radiology Report Generation with Multi-Agent RAG and Concept Bottleneck Models
di: Alam, Hasan Md Tusfiqur, et al.
Pubblicazione: (2025)
di: Alam, Hasan Md Tusfiqur, et al.
Pubblicazione: (2025)
EIVEN: Efficient Implicit Attribute Value Extraction using Multimodal LLM
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
Taxonomic Reasoning for Rare Arthropods: Combining Dense Image Captioning and RAG for Interpretable Classification
di: Lesperance, Nathaniel, et al.
Pubblicazione: (2025)
di: Lesperance, Nathaniel, et al.
Pubblicazione: (2025)
Revisit Anything: Visual Place Recognition via Image Segment Retrieval
di: Garg, Kartik, et al.
Pubblicazione: (2024)
di: Garg, Kartik, et al.
Pubblicazione: (2024)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
di: Giahi, Ramin, et al.
Pubblicazione: (2025)
di: Giahi, Ramin, et al.
Pubblicazione: (2025)
Beyond Matryoshka: Revisiting Sparse Coding for Adaptive Representation
di: Wen, Tiansheng, et al.
Pubblicazione: (2025)
di: Wen, Tiansheng, et al.
Pubblicazione: (2025)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive Survey
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024)
di: Dong, Junnan, et al.
Pubblicazione: (2024)
iRAG: Advancing RAG for Videos with an Incremental Approach
di: Arefeen, Md Adnan, et al.
Pubblicazione: (2024)
di: Arefeen, Md Adnan, et al.
Pubblicazione: (2024)
A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
Learning-Based Hashing for ANN Search: Foundations and Early Advances
di: Moran, Sean
Pubblicazione: (2025)
di: Moran, Sean
Pubblicazione: (2025)
Efficient Table QA via TableGrid Navigation and Progressive Inference Prompting
di: Maurya, Amritansh, et al.
Pubblicazione: (2026)
di: Maurya, Amritansh, et al.
Pubblicazione: (2026)
Attribute-Guided Multi-Level Attention Network for Fine-Grained Fashion Retrieval
di: Xiao, Ling, et al.
Pubblicazione: (2022)
di: Xiao, Ling, et al.
Pubblicazione: (2022)
FeatUp: A Model-Agnostic Framework for Features at Any Resolution
di: Fu, Stephanie, et al.
Pubblicazione: (2024)
di: Fu, Stephanie, et al.
Pubblicazione: (2024)
Data-Centric Approach to Constrained Machine Learning: A Case Study on Conway's Game of Life
di: Bibin, Anton, et al.
Pubblicazione: (2024)
di: Bibin, Anton, et al.
Pubblicazione: (2024)
Sustainable techniques to improve Data Quality for training image-based explanatory models for Recommender Systems
di: Paz-Ruza, Jorge, et al.
Pubblicazione: (2024)
di: Paz-Ruza, Jorge, et al.
Pubblicazione: (2024)
Character-based Outfit Generation with Vision-augmented Style Extraction via LLMs
di: Forouzandehmehr, Najmeh, et al.
Pubblicazione: (2024)
di: Forouzandehmehr, Najmeh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Open Multimodal Retrieval-Augmented Factual Image Generation
di: Tian, Yang, et al.
Pubblicazione: (2025) -
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
di: Fu, Chenghan, et al.
Pubblicazione: (2025) -
Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
di: Mannam, Varun, et al.
Pubblicazione: (2025) -
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026) -
Reasoning-Augmented Representations for Multimodal Retrieval
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)