MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shin, Joongmin, Park, Chanjun, Park, Jeongbae, Seo, Jaehyung, Lim, Heuiseok |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
par: Shin, Joongmin, et autres
Publié: (2026)
par: Shin, Joongmin, et autres
Publié: (2026)
HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
par: Shin, Joongmin, et autres
Publié: (2026)
par: Shin, Joongmin, et autres
Publié: (2026)
CoME: An Unlearning-based Approach to Conflict-free Model Editing
par: Jung, Dahyun, et autres
Publié: (2025)
par: Jung, Dahyun, et autres
Publié: (2025)
ChatLang-8: An LLM-Based Synthetic Data Generation Framework for Grammatical Error Correction
par: Park, Jeiyoon, et autres
Publié: (2024)
par: Park, Jeiyoon, et autres
Publié: (2024)
CharacterGPT: A Persona Reconstruction Framework for Role-Playing Agents
par: Park, Jeiyoon, et autres
Publié: (2024)
par: Park, Jeiyoon, et autres
Publié: (2024)
MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation
par: Park, Chanhee, et autres
Publié: (2025)
par: Park, Chanhee, et autres
Publié: (2025)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
par: Kim, Dongjun, et autres
Publié: (2025)
par: Kim, Dongjun, et autres
Publié: (2025)
Find the Intention of Instruction: Comprehensive Evaluation of Instruction Understanding for Large Language Models
par: Moon, Hyeonseok, et autres
Publié: (2024)
par: Moon, Hyeonseok, et autres
Publié: (2024)
The Impact of Negated Text on Hallucination with Large Language Models
par: Seo, Jaehyung, et autres
Publié: (2025)
par: Seo, Jaehyung, et autres
Publié: (2025)
Call for Rigor in Reporting Quality of Instruction Tuning Data
par: Moon, Hyeonseok, et autres
Publié: (2025)
par: Moon, Hyeonseok, et autres
Publié: (2025)
No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand
par: Jung, Jimin, et autres
Publié: (2026)
par: Jung, Jimin, et autres
Publié: (2026)
Alternative Speech: Complementary Method to Counter-Narrative for Better Discourse
par: Lee, Seungyoon, et autres
Publié: (2024)
par: Lee, Seungyoon, et autres
Publié: (2024)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
par: Jung, Dahyun, et autres
Publié: (2025)
par: Jung, Dahyun, et autres
Publié: (2025)
From Ambiguity to Accuracy: The Transformative Effect of Coreference Resolution on Retrieval-Augmented Generation systems
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
par: Kim, Dongjun, et autres
Publié: (2025)
par: Kim, Dongjun, et autres
Publié: (2025)
Translation of Multifaceted Data without Re-Training of Machine Translation Systems
par: Moon, Hyeonseok, et autres
Publié: (2024)
par: Moon, Hyeonseok, et autres
Publié: (2024)
Model-Based Data-Centric AI: Bridging the Divide Between Academic Ideals and Industrial Pragmatism
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimation
par: Chun, Yongchan, et autres
Publié: (2026)
par: Chun, Yongchan, et autres
Publié: (2026)
Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language Models
par: Park, Hyunbyung, et autres
Publié: (2024)
par: Park, Hyunbyung, et autres
Publié: (2024)
InstaTrans: An Instruction-Aware Translation Framework for Non-English Instruction Datasets
par: Kim, Yungi, et autres
Publié: (2024)
par: Kim, Yungi, et autres
Publié: (2024)
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models
par: Kim, Yungi, et autres
Publié: (2024)
par: Kim, Yungi, et autres
Publié: (2024)
Toward Practical Automatic Speech Recognition and Post-Processing: a Call for Explainable Error Benchmark Guideline
par: Koo, Seonmin, et autres
Publié: (2024)
par: Koo, Seonmin, et autres
Publié: (2024)
Analysis of Utterance Embeddings and Clustering Methods Related to Intent Induction for Task-Oriented Dialogue
par: Park, Jeiyoon, et autres
Publié: (2022)
par: Park, Jeiyoon, et autres
Publié: (2022)
Debate Only When Necessary: Adaptive Multiagent Collaboration for Efficient LLM Reasoning
par: Eo, Sugyeong, et autres
Publié: (2025)
par: Eo, Sugyeong, et autres
Publié: (2025)
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
par: Lu, Wensheng, et autres
Publié: (2025)
par: Lu, Wensheng, et autres
Publié: (2025)
ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction
par: Jung, Jeesu, et autres
Publié: (2025)
par: Jung, Jeesu, et autres
Publié: (2025)
M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
par: Park, Hyeongcheol, et autres
Publié: (2025)
par: Park, Hyeongcheol, et autres
Publié: (2025)
NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models
par: Moon, Hyeonseok, et autres
Publié: (2025)
par: Moon, Hyeonseok, et autres
Publié: (2025)
Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses
par: Eo, Sugyeong, et autres
Publié: (2026)
par: Eo, Sugyeong, et autres
Publié: (2026)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
par: Deng, Chao, et autres
Publié: (2024)
par: Deng, Chao, et autres
Publié: (2024)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
Sensory-Aware Sequential Recommendation via Review-Distilled Representations
par: Yoon, Yeo Chan, et autres
Publié: (2026)
par: Yoon, Yeo Chan, et autres
Publié: (2026)
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
LANGSAE EDITING: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal
par: Kim, Dongjun, et autres
Publié: (2026)
par: Kim, Dongjun, et autres
Publié: (2026)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
par: Zhang, Xuechen, et autres
Publié: (2025)
par: Zhang, Xuechen, et autres
Publié: (2025)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
par: Wang, Minzheng, et autres
Publié: (2024)
par: Wang, Minzheng, et autres
Publié: (2024)
Who speaks like a style of Vitamin: Towards Syntax-Aware DialogueSummarization using Multi-task Learning
par: Lee, Seolhwa, et autres
Publié: (2021)
par: Lee, Seolhwa, et autres
Publié: (2021)
Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrieval
par: Chun, Yongchan, et autres
Publié: (2025)
par: Chun, Yongchan, et autres
Publié: (2025)
Enhancing Retrieval Augmented Generation with Hierarchical Text Segmentation Chunking
par: Nguyen, Hai Toan, et autres
Publié: (2025)
par: Nguyen, Hai Toan, et autres
Publié: (2025)
Documents similaires
-
M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
par: Shin, Joongmin, et autres
Publié: (2026) -
HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
par: Shin, Joongmin, et autres
Publié: (2026) -
CoME: An Unlearning-based Approach to Conflict-free Model Editing
par: Jung, Dahyun, et autres
Publié: (2025) -
ChatLang-8: An LLM-Based Synthetic Data Generation Framework for Grammatical Error Correction
par: Park, Jeiyoon, et autres
Publié: (2024) -
CharacterGPT: A Persona Reconstruction Framework for Role-Playing Agents
par: Park, Jeiyoon, et autres
Publié: (2024)