Personal Visual Memory from Explicit and Implicit Evidence
Fuente:
arXiv
Salvato in:
| Autori principali: | Nguyen, Viet, Nguyen, Thao, Patel, Vishal M., Li, Yuheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
di: Guo, Minghao, et al.
Pubblicazione: (2026)
di: Guo, Minghao, et al.
Pubblicazione: (2026)
Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models
di: Xu, Yexing, et al.
Pubblicazione: (2026)
di: Xu, Yexing, et al.
Pubblicazione: (2026)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
di: Liu, Peiyang, et al.
Pubblicazione: (2026)
di: Liu, Peiyang, et al.
Pubblicazione: (2026)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Personalized Multimodal Large Language Models: A Survey
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
KiseKloset for Fashion Retrieval and Recommendation
di: Phan-Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
di: Phan-Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
di: Song, Tingyu, et al.
Pubblicazione: (2026)
di: Song, Tingyu, et al.
Pubblicazione: (2026)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
Towards Text-Image Interleaved Retrieval
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Attribute-Aware Implicit Modality Alignment for Text Attribute Person Search
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
di: Hou, Bohan, et al.
Pubblicazione: (2026)
di: Hou, Bohan, et al.
Pubblicazione: (2026)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
di: Guo, Hao, et al.
Pubblicazione: (2025)
di: Guo, Hao, et al.
Pubblicazione: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
di: Shi, Zhuofan, et al.
Pubblicazione: (2026)
di: Shi, Zhuofan, et al.
Pubblicazione: (2026)
Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
Learning Visual Composition through Improved Semantic Guidance
di: Stone, Austin, et al.
Pubblicazione: (2024)
di: Stone, Austin, et al.
Pubblicazione: (2024)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
Indexing Multimodal Language Models for Large-scale Image Retrieval
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
Multi-Vector Index Compression in Any Modality
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
ReinPool: Reinforcement Learning Pooling Multi-Vector Embeddings for Retrieval System
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
Efficient and High-Fidelity Omni Modality Retrieval
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
Improving Applicability of Deep Learning based Token Classification models during Training
di: Mehra, Anket, et al.
Pubblicazione: (2025)
di: Mehra, Anket, et al.
Pubblicazione: (2025)
ITEm: Unsupervised Image-Text Embedding Learning for eCommerce
di: Liao, Baohao, et al.
Pubblicazione: (2023)
di: Liao, Baohao, et al.
Pubblicazione: (2023)
Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
di: Martin, Alexander, et al.
Pubblicazione: (2025)
di: Martin, Alexander, et al.
Pubblicazione: (2025)
E5-V: Universal Embeddings with Multimodal Large Language Models
di: Jiang, Ting, et al.
Pubblicazione: (2024)
di: Jiang, Ting, et al.
Pubblicazione: (2024)
Large Language Model Informed Patent Image Retrieval
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections
di: Schneider, Florian, et al.
Pubblicazione: (2025)
di: Schneider, Florian, et al.
Pubblicazione: (2025)
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
di: Guo, Minghao, et al.
Pubblicazione: (2026) -
Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models
di: Xu, Yexing, et al.
Pubblicazione: (2026) -
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026) -
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026) -
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)