M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Shin, Joongmin, Park, Jeongbae, Seo, Jaehyung, Lim, Heuiseok |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
by: Shin, Joongmin, et al.
Published: (2026)
by: Shin, Joongmin, et al.
Published: (2026)
MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents
by: Shin, Joongmin, et al.
Published: (2026)
by: Shin, Joongmin, et al.
Published: (2026)
DocMMIR: A Framework for Document Multi-modal Information Retrieval
by: Li, Zirui, et al.
Published: (2025)
by: Li, Zirui, et al.
Published: (2025)
Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrieval
by: Chun, Yongchan, et al.
Published: (2025)
by: Chun, Yongchan, et al.
Published: (2025)
LANGSAE EDITING: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal
by: Kim, Dongjun, et al.
Published: (2026)
by: Kim, Dongjun, et al.
Published: (2026)
MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal
by: Jang, Youngjoon, et al.
Published: (2026)
by: Jang, Youngjoon, et al.
Published: (2026)
Cross-channel Recommendation for Multi-channel Retail
by: Choi, Yijin, et al.
Published: (2024)
by: Choi, Yijin, et al.
Published: (2024)
An Interactive Multi-modal Query Answering System with Retrieval-Augmented Large Language Models
by: Wang, Mengzhao, et al.
Published: (2024)
by: Wang, Mengzhao, et al.
Published: (2024)
VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation
by: Kim, Junyoung, et al.
Published: (2026)
by: Kim, Junyoung, et al.
Published: (2026)
Multi-modal Generative Models in Recommendation System
by: Ramisa, Arnau, et al.
Published: (2024)
by: Ramisa, Arnau, et al.
Published: (2024)
Chunk Knowledge Generation Model for Enhanced Information Retrieval: A Multi-task Learning Approach
by: Kim, Jisu, et al.
Published: (2025)
by: Kim, Jisu, et al.
Published: (2025)
Improving Multi-modal Recommender Systems by Denoising and Aligning Multi-modal Content and User Feedback
by: Xv, Guipeng, et al.
Published: (2024)
by: Xv, Guipeng, et al.
Published: (2024)
Rethinking Chunk Size For Long-Document Retrieval: A Multi-Dataset Analysis
by: Bhat, Sinchana Ramakanth, et al.
Published: (2025)
by: Bhat, Sinchana Ramakanth, et al.
Published: (2025)
Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework
by: Ortego, Diego, et al.
Published: (2025)
by: Ortego, Diego, et al.
Published: (2025)
SemBridge: Language Transfer in Sparse Encoders via Multilingual Semantic Bridges
by: Hong, Seongtae, et al.
Published: (2026)
by: Hong, Seongtae, et al.
Published: (2026)
Beyond Hard Negatives: The Importance of Score Distribution in Knowledge Distillation for Dense Retrieval
by: Jang, Youngjoon, et al.
Published: (2026)
by: Jang, Youngjoon, et al.
Published: (2026)
Towards Bridging the Cross-modal Semantic Gap for Multi-modal Recommendation
by: Wu, Xinglong, et al.
Published: (2024)
by: Wu, Xinglong, et al.
Published: (2024)
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models
by: Shi, Wentao, et al.
Published: (2025)
by: Shi, Wentao, et al.
Published: (2025)
Multi-view-guided Passage Reranking with Large Language Models
by: Na, Jeongwoo, et al.
Published: (2025)
by: Na, Jeongwoo, et al.
Published: (2025)
Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory
by: Liu, Yanming, et al.
Published: (2026)
by: Liu, Yanming, et al.
Published: (2026)
DocReRank: Single-Page Hard Negative Query Generation for Training Multi-Modal RAG Rerankers
by: Wasserman, Navve, et al.
Published: (2025)
by: Wasserman, Navve, et al.
Published: (2025)
Improving Korean-English Cross-Lingual Retrieval: A Data-Centric Study of Language Composition and Model Merging
by: Jang, Youngjoon, et al.
Published: (2025)
by: Jang, Youngjoon, et al.
Published: (2025)
Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models
by: Jin, Yichao, et al.
Published: (2025)
by: Jin, Yichao, et al.
Published: (2025)
Relevance Matters: A Multi-Task and Multi-Stage Large Language Model Approach for E-commerce Query Rewriting
by: Dai, Aijun, et al.
Published: (2026)
by: Dai, Aijun, et al.
Published: (2026)
Improving Semantic Proximity in Information Retrieval through Cross-Lingual Alignment
by: Hong, Seongtae, et al.
Published: (2026)
by: Hong, Seongtae, et al.
Published: (2026)
Disentangling Specificity for Abstractive Multi-document Summarization
by: Ma, Congbo, et al.
Published: (2024)
by: Ma, Congbo, et al.
Published: (2024)
UMAIR-FPS: User-aware Multi-modal Animation Illustration Recommendation Fusion with Painting Style
by: Kang, Yan, et al.
Published: (2024)
by: Kang, Yan, et al.
Published: (2024)
A Unified Retrieval Framework with Document Ranking and EDU Filtering for Multi-document Summarization
by: Tan, Shiyin, et al.
Published: (2025)
by: Tan, Shiyin, et al.
Published: (2025)
An Empirical Study of Training ID-Agnostic Multi-modal Sequential Recommenders
by: Li, Youhua, et al.
Published: (2024)
by: Li, Youhua, et al.
Published: (2024)
Deep Class-guided Hashing for Multi-label Cross-modal Retrieval
by: Chen, Hao, et al.
Published: (2024)
by: Chen, Hao, et al.
Published: (2024)
Multi-modal Food Recommendation using Clustering and Self-supervised Learning
by: Zhang, Yixin, et al.
Published: (2024)
by: Zhang, Yixin, et al.
Published: (2024)
MDF: A Dynamic Fusion Model for Multi-modal Fake News Detection
by: Lv, Hongzhen, et al.
Published: (2024)
by: Lv, Hongzhen, et al.
Published: (2024)
MRSE: An Efficient Multi-modality Retrieval System for Large Scale E-commerce
by: Jiang, Hao, et al.
Published: (2024)
by: Jiang, Hao, et al.
Published: (2024)
A Unified Framework for Multi-Domain CTR Prediction via Large Language Models
by: Fu, Zichuan, et al.
Published: (2023)
by: Fu, Zichuan, et al.
Published: (2023)
Towards Transfer-Efficient Multi-modal Sequential Recommendation with State Space Duality
by: Fan, Hao, et al.
Published: (2025)
by: Fan, Hao, et al.
Published: (2025)
RankFlow: A Multi-Role Collaborative Reranking Workflow Utilizing Large Language Models
by: Jin, Can, et al.
Published: (2025)
by: Jin, Can, et al.
Published: (2025)
MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling
by: Yan, Bencheng, et al.
Published: (2025)
by: Yan, Bencheng, et al.
Published: (2025)
Long document summarization using page specific target text alignment and distilling page importance
by: Devi, Pushpa, et al.
Published: (2025)
by: Devi, Pushpa, et al.
Published: (2025)
Yambda-5B -- A Large-Scale Multi-modal Dataset for Ranking And Retrieval
by: Ploshkin, A., et al.
Published: (2025)
by: Ploshkin, A., et al.
Published: (2025)
Leveraging Intra-modal and Inter-modal Interaction for Multi-Modal Entity Alignment
by: Hu, Zhiwei, et al.
Published: (2024)
by: Hu, Zhiwei, et al.
Published: (2024)
Similar Items
-
HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
by: Shin, Joongmin, et al.
Published: (2026) -
MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents
by: Shin, Joongmin, et al.
Published: (2026) -
DocMMIR: A Framework for Document Multi-modal Information Retrieval
by: Li, Zirui, et al.
Published: (2025) -
Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrieval
by: Chun, Yongchan, et al.
Published: (2025) -
LANGSAE EDITING: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal
by: Kim, Dongjun, et al.
Published: (2026)