Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Yibo, Huo, Jiahao, Feng, Guanbo, Ou, Mingdong, Cao, Yi, Zou, Xin, Liu, Shuliang, Lyu, Yuanhuiyi, Huang, Yu, Li, Jungang, Zheng, Kening, Zheng, Xu, Yu, Philip S., Kwok, James, Hu, Xuming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning
di: Yan, Yibo, et al.
Pubblicazione: (2025)
di: Yan, Yibo, et al.
Pubblicazione: (2025)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
di: Zheng, Kening, et al.
Pubblicazione: (2024)
di: Zheng, Kening, et al.
Pubblicazione: (2024)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models
di: Zou, Xin, et al.
Pubblicazione: (2024)
di: Zou, Xin, et al.
Pubblicazione: (2024)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
di: Zheng, Kening, et al.
Pubblicazione: (2026)
di: Zheng, Kening, et al.
Pubblicazione: (2026)
SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2025)
di: Chen, Junkai, et al.
Pubblicazione: (2025)
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
di: Li, Jungang, et al.
Pubblicazione: (2024)
di: Li, Jungang, et al.
Pubblicazione: (2024)
Unlocking Speech Instruction Data Potential with Query Rewriting
di: Hei, Yonghua, et al.
Pubblicazione: (2025)
di: Hei, Yonghua, et al.
Pubblicazione: (2025)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
di: Zou, Xin, et al.
Pubblicazione: (2025)
di: Zou, Xin, et al.
Pubblicazione: (2025)
MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection
di: Yan, Yibo, et al.
Pubblicazione: (2025)
di: Yan, Yibo, et al.
Pubblicazione: (2025)
MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models
di: Hu, Xuming, et al.
Pubblicazione: (2025)
di: Hu, Xuming, et al.
Pubblicazione: (2025)
EgoIntent: An Egocentric Step-level Benchmark for Understanding What, Why, and Next
di: Pan, Ye, et al.
Pubblicazione: (2026)
di: Pan, Ye, et al.
Pubblicazione: (2026)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
di: Yan, Yibo, et al.
Pubblicazione: (2024)
di: Yan, Yibo, et al.
Pubblicazione: (2024)
PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
di: Zheng, Qi, et al.
Pubblicazione: (2026)
di: Zheng, Qi, et al.
Pubblicazione: (2026)
Refiner: Restructure Retrieval Content Efficiently to Advance Question-Answering Capabilities
di: Li, Zhonghao, et al.
Pubblicazione: (2024)
di: Li, Zhonghao, et al.
Pubblicazione: (2024)
MINER: Mining the Underlying Pattern of Modality-Specific Neurons in Multimodal Large Language Models
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation
di: Jia, Sihang, et al.
Pubblicazione: (2026)
di: Jia, Sihang, et al.
Pubblicazione: (2026)
Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
Video Signature: Implicit Watermarking for Video Diffusion Models
di: Huang, Yu, et al.
Pubblicazione: (2025)
di: Huang, Yu, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit Analysis
di: Huang, Haoming, et al.
Pubblicazione: (2025)
di: Huang, Haoming, et al.
Pubblicazione: (2025)
TreeHop: Generate and Filter Next Query Embeddings Efficiently for Multi-hop Question Answering
di: Li, Zhonghao, et al.
Pubblicazione: (2025)
di: Li, Zhonghao, et al.
Pubblicazione: (2025)
CoheMark: A Novel Sentence-Level Watermark for Enhanced Text Quality
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Class-Agnostic Region-of-Interest Matching in Document Images
di: Zhang, Demin, et al.
Pubblicazione: (2025)
di: Zhang, Demin, et al.
Pubblicazione: (2025)
TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders
di: Li, Teng, et al.
Pubblicazione: (2026)
di: Li, Teng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026) -
Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations
di: Yan, Yibo, et al.
Pubblicazione: (2026) -
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026) -
CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding
di: Huo, Jiahao, et al.
Pubblicazione: (2026) -
MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models
di: Huo, Jiahao, et al.
Pubblicazione: (2025)