A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity
Fuente:
arXiv
Salvato in:
| Autori principali: | Shaukat, Muhammad Arslan, Adnan, Muntasir, Kuhn, Carlos C. N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Debugging Decay Index: Rethinking Debugging Strategies for Code LLMs
di: Adnan, Muntasir, et al.
Pubblicazione: (2025)
di: Adnan, Muntasir, et al.
Pubblicazione: (2025)
Adaptive Hierarchical Evaluation of LLMs and SAST tools for CWE Prediction in Python
di: Adnan, Muntasir, et al.
Pubblicazione: (2026)
di: Adnan, Muntasir, et al.
Pubblicazione: (2026)
Enhancing Depressive Post Detection in Bangla: A Comparative Study of TF-IDF, BERT and FastText Embeddings
di: Sazan, Saad Ahmed, et al.
Pubblicazione: (2024)
di: Sazan, Saad Ahmed, et al.
Pubblicazione: (2024)
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
di: Lu, Wensheng, et al.
Pubblicazione: (2025)
di: Lu, Wensheng, et al.
Pubblicazione: (2025)
Investigating OCR-Sensitive Neurons to Improve Entity Recognition in Historical Documents
di: Boros, Emanuela, et al.
Pubblicazione: (2024)
di: Boros, Emanuela, et al.
Pubblicazione: (2024)
Chunking German Legal Code
di: Prior, Max, et al.
Pubblicazione: (2026)
di: Prior, Max, et al.
Pubblicazione: (2026)
Chunk-Distilled Language Modeling
di: Li, Yanhong, et al.
Pubblicazione: (2024)
di: Li, Yanhong, et al.
Pubblicazione: (2024)
Large Language Model Guided Self-Debugging Code Generation
di: Adnan, Muntasir, et al.
Pubblicazione: (2025)
di: Adnan, Muntasir, et al.
Pubblicazione: (2025)
MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents
di: Shin, Joongmin, et al.
Pubblicazione: (2026)
di: Shin, Joongmin, et al.
Pubblicazione: (2026)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
di: Stankovic, Mile
Pubblicazione: (2025)
di: Stankovic, Mile
Pubblicazione: (2025)
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
di: Júnior, Paulo Roberto de Moura, et al.
Pubblicazione: (2026)
di: Júnior, Paulo Roberto de Moura, et al.
Pubblicazione: (2026)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
di: Wu, Kaifeng, et al.
Pubblicazione: (2025)
di: Wu, Kaifeng, et al.
Pubblicazione: (2025)
Reconstructing Context: Evaluating Advanced Chunking Strategies for Retrieval-Augmented Generation
di: Merola, Carlo, et al.
Pubblicazione: (2025)
di: Merola, Carlo, et al.
Pubblicazione: (2025)
ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking
di: Ciancone, Mathieu, et al.
Pubblicazione: (2025)
di: Ciancone, Mathieu, et al.
Pubblicazione: (2025)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
di: Chen, Huiyao, et al.
Pubblicazione: (2025)
di: Chen, Huiyao, et al.
Pubblicazione: (2025)
Contextual Document Embeddings
di: Morris, John X., et al.
Pubblicazione: (2024)
di: Morris, John X., et al.
Pubblicazione: (2024)
A New HOPE: Domain-agnostic Automatic Evaluation of Text Chunking
di: Brådland, Henrik, et al.
Pubblicazione: (2025)
di: Brådland, Henrik, et al.
Pubblicazione: (2025)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
Evaluating Financial Sentiment Analysis with Annotators Instruction Assisted Prompting: Enhancing Contextual Interpretation and Stock Prediction Accuracy
di: Rahman, A M Muntasir, et al.
Pubblicazione: (2025)
di: Rahman, A M Muntasir, et al.
Pubblicazione: (2025)
Enhancing Retrieval Augmented Generation with Hierarchical Text Segmentation Chunking
di: Nguyen, Hai Toan, et al.
Pubblicazione: (2025)
di: Nguyen, Hai Toan, et al.
Pubblicazione: (2025)
Chunk, Align, Select: A Simple Long-sequence Processing Method for Transformers
di: Xie, Jiawen, et al.
Pubblicazione: (2023)
di: Xie, Jiawen, et al.
Pubblicazione: (2023)
Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering
di: Maharjan, Anuj, et al.
Pubblicazione: (2026)
di: Maharjan, Anuj, et al.
Pubblicazione: (2026)
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs
di: Yu, Dongxing
Pubblicazione: (2025)
di: Yu, Dongxing
Pubblicazione: (2025)
Political Events using RAG with LLMs
di: Arslan, Muhammad, et al.
Pubblicazione: (2025)
di: Arslan, Muhammad, et al.
Pubblicazione: (2025)
Sustainable Digitalization of Business with Multi-Agent RAG and LLM
di: Arslan, Muhammad, et al.
Pubblicazione: (2025)
di: Arslan, Muhammad, et al.
Pubblicazione: (2025)
Revealing the Numeracy Gap: An Empirical Investigation of Text Embedding Models
di: Deng, Ningyuan, et al.
Pubblicazione: (2025)
di: Deng, Ningyuan, et al.
Pubblicazione: (2025)
H-Net++: Hierarchical Dynamic Chunking for Tokenizer-Free Language Modelling in Morphologically-Rich Languages
di: Zakershahrak, Mehrdad, et al.
Pubblicazione: (2025)
di: Zakershahrak, Mehrdad, et al.
Pubblicazione: (2025)
Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
QCG-Rerank: Chunks Graph Rerank with Query Expansion in Retrieval-Augmented LLMs for Tourism Domain
di: Wei, Qikai, et al.
Pubblicazione: (2024)
di: Wei, Qikai, et al.
Pubblicazione: (2024)
Grounding Language Model with Chunking-Free In-Context Retrieval
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings
di: Icard, Benjamin, et al.
Pubblicazione: (2026)
di: Icard, Benjamin, et al.
Pubblicazione: (2026)
Unleashing Artificial Cognition: Integrating Multiple AI Systems
di: Adnan, Muntasir, et al.
Pubblicazione: (2024)
di: Adnan, Muntasir, et al.
Pubblicazione: (2024)
A Multi-Strategy Approach for AI-Generated Text Detection
di: Zain, Ali, et al.
Pubblicazione: (2025)
di: Zain, Ali, et al.
Pubblicazione: (2025)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
di: Alkaeed, Mahdi, et al.
Pubblicazione: (2026)
di: Alkaeed, Mahdi, et al.
Pubblicazione: (2026)
Investigating Text Shortening Strategy in BERT: Truncation vs Summarization
di: Mutasodirin, Mirza Alim, et al.
Pubblicazione: (2024)
di: Mutasodirin, Mirza Alim, et al.
Pubblicazione: (2024)
Factuality of Large Language Models: A Survey
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
Mix-of-Granularity: Optimize the Chunking Granularity for Retrieval-Augmented Generation
di: Zhong, Zijie, et al.
Pubblicazione: (2024)
di: Zhong, Zijie, et al.
Pubblicazione: (2024)
Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The Debugging Decay Index: Rethinking Debugging Strategies for Code LLMs
di: Adnan, Muntasir, et al.
Pubblicazione: (2025) -
Adaptive Hierarchical Evaluation of LLMs and SAST tools for CWE Prediction in Python
di: Adnan, Muntasir, et al.
Pubblicazione: (2026) -
Enhancing Depressive Post Detection in Bangla: A Comparative Study of TF-IDF, BERT and FastText Embeddings
di: Sazan, Saad Ahmed, et al.
Pubblicazione: (2024) -
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
di: Lu, Wensheng, et al.
Pubblicazione: (2025) -
Investigating OCR-Sensitive Neurons to Improve Entity Recognition in Historical Documents
di: Boros, Emanuela, et al.
Pubblicazione: (2024)