Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Xi, Suyang, Yang, Chenxi, Ding, Hong, Ni, Yiqing, Liu, Catherine C., Liu, Yunhao, Zhang, Chengqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Medical Image Binding via Shared Text Embeddings
por: Liu, Yunhao, et al.
Publicado: (2025)
por: Liu, Yunhao, et al.
Publicado: (2025)
Retrieval Augmented Comic Image Generation
por: Shui, Yunhao, et al.
Publicado: (2025)
por: Shui, Yunhao, et al.
Publicado: (2025)
Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner
por: Cai, Pengxiang, et al.
Publicado: (2024)
por: Cai, Pengxiang, et al.
Publicado: (2024)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
por: Yang, Liu, et al.
Publicado: (2025)
por: Yang, Liu, et al.
Publicado: (2025)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
por: Sun, Kaiyue, et al.
Publicado: (2025)
por: Sun, Kaiyue, et al.
Publicado: (2025)
Retrieval Augmented Image Harmonization
por: Wang, Haolin, et al.
Publicado: (2024)
por: Wang, Haolin, et al.
Publicado: (2024)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
por: Huang, Zhe, et al.
Publicado: (2025)
por: Huang, Zhe, et al.
Publicado: (2025)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
por: Peng, Yibo, et al.
Publicado: (2026)
por: Peng, Yibo, et al.
Publicado: (2026)
Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities
por: Liu, Huan, et al.
Publicado: (2024)
por: Liu, Huan, et al.
Publicado: (2024)
FreeRet: MLLMs as Training-Free Retrievers
por: Zhu, Yuhan, et al.
Publicado: (2025)
por: Zhu, Yuhan, et al.
Publicado: (2025)
UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
por: Guo, Qin, et al.
Publicado: (2025)
por: Guo, Qin, et al.
Publicado: (2025)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
por: Xu, Zitong, et al.
Publicado: (2026)
por: Xu, Zitong, et al.
Publicado: (2026)
RelativeFlow: Taming Medical Image Denoising Learning with Noisy Reference
por: Liu, Yuxin, et al.
Publicado: (2026)
por: Liu, Yuxin, et al.
Publicado: (2026)
Retrieval Augmented Recipe Generation
por: Liu, Guoshan, et al.
Publicado: (2024)
por: Liu, Guoshan, et al.
Publicado: (2024)
OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner
por: Jiang, Haoyang, et al.
Publicado: (2026)
por: Jiang, Haoyang, et al.
Publicado: (2026)
FunBench: Benchmarking Fundus Reading Skills of MLLMs
por: Wei, Qijie, et al.
Publicado: (2025)
por: Wei, Qijie, et al.
Publicado: (2025)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
por: Qi, Jingyuan, et al.
Publicado: (2025)
por: Qi, Jingyuan, et al.
Publicado: (2025)
RAGAR: Retrieval Augmented Personalized Image Generation Guided by Recommendation
por: Ling, Run, et al.
Publicado: (2025)
por: Ling, Run, et al.
Publicado: (2025)
ColorFlow: Retrieval-Augmented Image Sequence Colorization
por: Zhuang, Junhao, et al.
Publicado: (2024)
por: Zhuang, Junhao, et al.
Publicado: (2024)
Image Generation Diversity Issues and How to Tame Them
por: Dombrowski, Mischa, et al.
Publicado: (2024)
por: Dombrowski, Mischa, et al.
Publicado: (2024)
Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
por: Zhu, Fangrui, et al.
Publicado: (2025)
por: Zhu, Fangrui, et al.
Publicado: (2025)
MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
por: Zhu, Chenhui, et al.
Publicado: (2025)
por: Zhu, Chenhui, et al.
Publicado: (2025)
Shapley Values-enabled Progressive Pseudo Bag Augmentation for Whole Slide Image Classification
por: Yan, Renao, et al.
Publicado: (2023)
por: Yan, Renao, et al.
Publicado: (2023)
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
por: You, Xiaoxing, et al.
Publicado: (2025)
por: You, Xiaoxing, et al.
Publicado: (2025)
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
por: Lou, Haoran, et al.
Publicado: (2026)
por: Lou, Haoran, et al.
Publicado: (2026)
Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval
por: Chen, Xianke, et al.
Publicado: (2026)
por: Chen, Xianke, et al.
Publicado: (2026)
A Conditional Generative Framework for Synthetic Data Augmentation in Segmenting Thin and Elongated Structures in Biological Images
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
TACO: Taming Diffusion for in-the-wild Video Amodal Completion
por: Lu, Ruijie, et al.
Publicado: (2025)
por: Lu, Ruijie, et al.
Publicado: (2025)
Taming Stable Diffusion for Text to 360° Panorama Image Generation
por: Zhang, Cheng, et al.
Publicado: (2024)
por: Zhang, Cheng, et al.
Publicado: (2024)
Taming Generative Diffusion Prior for Universal Blind Image Restoration
por: Tu, Siwei, et al.
Publicado: (2024)
por: Tu, Siwei, et al.
Publicado: (2024)
ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions
por: Wang, Zikai, et al.
Publicado: (2026)
por: Wang, Zikai, et al.
Publicado: (2026)
Taming Teacher Forcing for Masked Autoregressive Video Generation
por: Zhou, Deyu, et al.
Publicado: (2025)
por: Zhou, Deyu, et al.
Publicado: (2025)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
por: Feng, Yutong, et al.
Publicado: (2023)
por: Feng, Yutong, et al.
Publicado: (2023)
LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented Diffusion
por: Zhao, Pancheng, et al.
Publicado: (2024)
por: Zhao, Pancheng, et al.
Publicado: (2024)
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
por: Li, Yinglu, et al.
Publicado: (2025)
por: Li, Yinglu, et al.
Publicado: (2025)
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
por: Song, Chenxi, et al.
Publicado: (2025)
por: Song, Chenxi, et al.
Publicado: (2025)
Harnessing the Power of MLLMs for Transferable Text-to-Image Person ReID
por: Tan, Wentao, et al.
Publicado: (2024)
por: Tan, Wentao, et al.
Publicado: (2024)
Open Multimodal Retrieval-Augmented Factual Image Generation
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Medical Image Binding via Shared Text Embeddings
por: Liu, Yunhao, et al.
Publicado: (2025) -
Retrieval Augmented Comic Image Generation
por: Shui, Yunhao, et al.
Publicado: (2025) -
Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner
por: Cai, Pengxiang, et al.
Publicado: (2024) -
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
por: Zhang, Tao, et al.
Publicado: (2025) -
ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
por: Yang, Liu, et al.
Publicado: (2025)