Open Multimodal Retrieval-Augmented Factual Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tian, Yang, Liu, Fan, Zhang, Jingyuan, Bi, Wei, Hu, Yupeng, Nie, Liqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
por: Luo, Linyin, et al.
Publicado: (2025)
por: Luo, Linyin, et al.
Publicado: (2025)
A Comprehensive Survey on Composed Image Retrieval
por: Song, Xuemeng, et al.
Publicado: (2025)
por: Song, Xuemeng, et al.
Publicado: (2025)
CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
CaLa: Complementary Association Learning for Augmenting Composed Image Retrieval
por: Jiang, Xintong, et al.
Publicado: (2024)
por: Jiang, Xintong, et al.
Publicado: (2024)
Diffusion Augmented Retrieval: A Training-Free Approach to Interactive Text-to-Image Retrieval
por: Long, Zijun, et al.
Publicado: (2025)
por: Long, Zijun, et al.
Publicado: (2025)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
por: Yang, Wei, et al.
Publicado: (2025)
por: Yang, Wei, et al.
Publicado: (2025)
Reasoning-Augmented Representations for Multimodal Retrieval
por: Zhang, Jianrui, et al.
Publicado: (2026)
por: Zhang, Jianrui, et al.
Publicado: (2026)
MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation
por: Hsiao, Chi-Hsiang, et al.
Publicado: (2025)
por: Hsiao, Chi-Hsiang, et al.
Publicado: (2025)
Video Enriched Retrieval Augmented Generation Using Aligned Video Captions
por: Rosa, Kevin Dela
Publicado: (2024)
por: Rosa, Kevin Dela
Publicado: (2024)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
por: Ren, Xubin, et al.
Publicado: (2025)
por: Ren, Xubin, et al.
Publicado: (2025)
Retrieval-Guided Generation for Safer Histopathology Image Captioning
por: Hoq, Md. Enamul, et al.
Publicado: (2026)
por: Hoq, Md. Enamul, et al.
Publicado: (2026)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
por: Luo, Weiqing, et al.
Publicado: (2026)
por: Luo, Weiqing, et al.
Publicado: (2026)
Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
por: Liu, Peiyang, et al.
Publicado: (2026)
por: Liu, Peiyang, et al.
Publicado: (2026)
Invisible Relevance Bias: Text-Image Retrieval Models Prefer AI-Generated Images
por: Xu, Shicheng, et al.
Publicado: (2023)
por: Xu, Shicheng, et al.
Publicado: (2023)
XL-HeadTags: Leveraging Multimodal Retrieval Augmentation for the Multilingual Generation of News Headlines and Tags
por: Shohan, Faisal Tareque, et al.
Publicado: (2024)
por: Shohan, Faisal Tareque, et al.
Publicado: (2024)
RAVEN: Multitask Retrieval Augmented Vision-Language Learning
por: Rao, Varun Nagaraj, et al.
Publicado: (2024)
por: Rao, Varun Nagaraj, et al.
Publicado: (2024)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
por: Zhou, Yinan, et al.
Publicado: (2025)
por: Zhou, Yinan, et al.
Publicado: (2025)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
por: Yang, Yuxin, et al.
Publicado: (2025)
por: Yang, Yuxin, et al.
Publicado: (2025)
MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions
por: Zhang, Kai, et al.
Publicado: (2024)
por: Zhang, Kai, et al.
Publicado: (2024)
Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery
por: Arefeen, Md Adnan, et al.
Publicado: (2026)
por: Arefeen, Md Adnan, et al.
Publicado: (2026)
Smart Routing for Multimodal Video Retrieval: When to Search What
por: Rosa, Kevin Dela
Publicado: (2025)
por: Rosa, Kevin Dela
Publicado: (2025)
Benchmark Granularity and Model Robustness for Image-Text Retrieval
por: Hendriksen, Mariya, et al.
Publicado: (2024)
por: Hendriksen, Mariya, et al.
Publicado: (2024)
Weakly Supervised Deep Hyperspherical Quantization for Image Retrieval
por: Wang, Jinpeng, et al.
Publicado: (2024)
por: Wang, Jinpeng, et al.
Publicado: (2024)
ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
por: Ghosh, Arijit, et al.
Publicado: (2026)
por: Ghosh, Arijit, et al.
Publicado: (2026)
ImageGem: In-the-wild Generative Image Interaction Dataset for Generative Model Personalization
por: Guo, Yuanhe, et al.
Publicado: (2025)
por: Guo, Yuanhe, et al.
Publicado: (2025)
A Survey of Multimodal Composite Editing and Retrieval
por: Li, Suyan, et al.
Publicado: (2024)
por: Li, Suyan, et al.
Publicado: (2024)
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
por: Lu, Xin, et al.
Publicado: (2023)
por: Lu, Xin, et al.
Publicado: (2023)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
por: Giahi, Ramin, et al.
Publicado: (2025)
por: Giahi, Ramin, et al.
Publicado: (2025)
Content-Based Image Retrieval for Multi-Class Volumetric Radiology Images: A Benchmark Study
por: Jush, Farnaz Khun, et al.
Publicado: (2024)
por: Jush, Farnaz Khun, et al.
Publicado: (2024)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
por: Tanaka, Ryota, et al.
Publicado: (2025)
por: Tanaka, Ryota, et al.
Publicado: (2025)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
por: Long, Zijun, et al.
Publicado: (2024)
por: Long, Zijun, et al.
Publicado: (2024)
Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
por: Thanh, Toan Le Ngo, et al.
Publicado: (2025)
PHPQ: Pyramid Hybrid Pooling Quantization for Efficient Fine-Grained Image Retrieval
por: Zeng, Ziyun, et al.
Publicado: (2021)
por: Zeng, Ziyun, et al.
Publicado: (2021)
Multi-task Cross-modal Learning for Chest X-ray Image Retrieval
por: Liang, Zhaohui, et al.
Publicado: (2026)
por: Liang, Zhaohui, et al.
Publicado: (2026)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
por: Ju, Yeong-Joon, et al.
Publicado: (2024)
HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel Retrieval
por: Askari, Arian, et al.
Publicado: (2025)
por: Askari, Arian, et al.
Publicado: (2025)
Are They the Same Picture? Adapting Concept Bottleneck Models for Human-AI Collaboration in Image Retrieval
por: Balloli, Vaibhav, et al.
Publicado: (2024)
por: Balloli, Vaibhav, et al.
Publicado: (2024)
Compressible and Searchable: AI-native Multi-Modal Retrieval System with Learned Image Compression
por: Luo, Jixiang
Publicado: (2024)
por: Luo, Jixiang
Publicado: (2024)
Ejemplares similares
-
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024) -
HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
por: Luo, Linyin, et al.
Publicado: (2025) -
A Comprehensive Survey on Composed Image Retrieval
por: Song, Xuemeng, et al.
Publicado: (2025) -
CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG
por: Tian, Yang, et al.
Publicado: (2025) -
CaLa: Complementary Association Learning for Augmenting Composed Image Retrieval
por: Jiang, Xintong, et al.
Publicado: (2024)