ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking
Fuente:
arXiv
Salvato in:
| Autori principali: | Ciancone, Mathieu, Varangot-Reille, Clovis, Schaeffer, Marion |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems
di: Varangot-Reille, Clovis, et al.
Pubblicazione: (2025)
di: Varangot-Reille, Clovis, et al.
Pubblicazione: (2025)
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
di: Júnior, Paulo Roberto de Moura, et al.
Pubblicazione: (2026)
di: Júnior, Paulo Roberto de Moura, et al.
Pubblicazione: (2026)
Empirical Evaluation of PDF Parsing and Chunking for Financial Question Answering with RAG
di: Bachyr, Omar El, et al.
Pubblicazione: (2026)
di: Bachyr, Omar El, et al.
Pubblicazione: (2026)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
Grounding Language Model with Chunking-Free In-Context Retrieval
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
di: Qian, Hongjin, et al.
Pubblicazione: (2024)
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
di: Stankovic, Mile
Pubblicazione: (2025)
di: Stankovic, Mile
Pubblicazione: (2025)
MTEB-French: Resources for French Sentence Embedding Evaluation and Analysis
di: Ciancone, Mathieu, et al.
Pubblicazione: (2024)
di: Ciancone, Mathieu, et al.
Pubblicazione: (2024)
The Chronicles of RAG: The Retriever, the Chunk and the Generator
di: Finardi, Paulo, et al.
Pubblicazione: (2024)
di: Finardi, Paulo, et al.
Pubblicazione: (2024)
Reconstructing Context: Evaluating Advanced Chunking Strategies for Retrieval-Augmented Generation
di: Merola, Carlo, et al.
Pubblicazione: (2025)
di: Merola, Carlo, et al.
Pubblicazione: (2025)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
di: Wu, Kaifeng, et al.
Pubblicazione: (2025)
di: Wu, Kaifeng, et al.
Pubblicazione: (2025)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
di: Chen, Huiyao, et al.
Pubblicazione: (2025)
di: Chen, Huiyao, et al.
Pubblicazione: (2025)
Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering
di: Maharjan, Anuj, et al.
Pubblicazione: (2026)
di: Maharjan, Anuj, et al.
Pubblicazione: (2026)
Tabular PDF Information Extraction with Local LLMs and Layout-Aware Parsing: A Reliability Evaluation
di: Hilmi, Muhammad Anis Al, et al.
Pubblicazione: (2026)
di: Hilmi, Muhammad Anis Al, et al.
Pubblicazione: (2026)
cAST: Enhancing Code Retrieval-Augmented Generation with Structural Chunking via Abstract Syntax Tree
di: Zhang, Yilin, et al.
Pubblicazione: (2025)
di: Zhang, Yilin, et al.
Pubblicazione: (2025)
Agentic Chunking and Bayesian De-chunking of AI Generated Fuzzy Cognitive Maps: A Model of the Thucydides Trap
di: Panda, Akash Kumar, et al.
Pubblicazione: (2026)
di: Panda, Akash Kumar, et al.
Pubblicazione: (2026)
Is Semantic Chunking Worth the Computational Cost?
di: Qu, Renyi, et al.
Pubblicazione: (2024)
di: Qu, Renyi, et al.
Pubblicazione: (2024)
Chunk Knowledge Generation Model for Enhanced Information Retrieval: A Multi-task Learning Approach
di: Kim, Jisu, et al.
Pubblicazione: (2025)
di: Kim, Jisu, et al.
Pubblicazione: (2025)
A Systematic Analysis of Chunking Strategies for Reliable Question Answering
di: Bennani, Sofia, et al.
Pubblicazione: (2026)
di: Bennani, Sofia, et al.
Pubblicazione: (2026)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Structure-Aware Chunking for Tabular Data in Retrieval-Augmented Generation
di: Guttal, Pooja, et al.
Pubblicazione: (2026)
di: Guttal, Pooja, et al.
Pubblicazione: (2026)
Graph-Aware Late Chunking for Retrieval-Augmented Generation in Biomedical Literature
di: Mortezaagha, Pouria, et al.
Pubblicazione: (2026)
di: Mortezaagha, Pouria, et al.
Pubblicazione: (2026)
Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities
di: Zhu, Yurui, et al.
Pubblicazione: (2026)
di: Zhu, Yurui, et al.
Pubblicazione: (2026)
Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documents
di: Taiwo, Samuel, et al.
Pubblicazione: (2026)
di: Taiwo, Samuel, et al.
Pubblicazione: (2026)
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
di: Günther, Michael, et al.
Pubblicazione: (2024)
di: Günther, Michael, et al.
Pubblicazione: (2024)
Query-Adaptive Semantic Chunking for Retrieval-Augmented Generation: A Dynamic Strategy with Contextual Window Expansion
di: Rastogi, Mudit
Pubblicazione: (2026)
di: Rastogi, Mudit
Pubblicazione: (2026)
Web Retrieval-Aware Chunking (W-RAC) for Efficient and Cost-Effective Retrieval-Augmented Generation Systems
di: Allu, Uday, et al.
Pubblicazione: (2026)
di: Allu, Uday, et al.
Pubblicazione: (2026)
Leveraging the Power of LLMs: A Fine-Tuning Approach for High-Quality Aspect-Based Summarization
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
PromptRefine: Enhancing Few-Shot Performance on Low-Resource Indic Languages with Example Selection from Related Example Banks
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
di: Shin, Joongmin, et al.
Pubblicazione: (2026)
di: Shin, Joongmin, et al.
Pubblicazione: (2026)
Vision-Guided Chunking Is All You Need: Enhancing RAG with Multimodal Document Understanding
di: Tripathi, Vishesh, et al.
Pubblicazione: (2025)
di: Tripathi, Vishesh, et al.
Pubblicazione: (2025)
Reliable Evaluation Protocol for Low-Precision Retrieval
di: Yang, Kisu, et al.
Pubblicazione: (2025)
di: Yang, Kisu, et al.
Pubblicazione: (2025)
S2 Chunking: A Hybrid Framework for Document Segmentation Through Integrated Spatial and Semantic Analysis
di: Verma, Prashant
Pubblicazione: (2025)
di: Verma, Prashant
Pubblicazione: (2025)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
Evaluating ChatGPT as a Recommender System: A Rigorous Approach
di: Di Palma, Dario, et al.
Pubblicazione: (2023)
di: Di Palma, Dario, et al.
Pubblicazione: (2023)
Optimizing Agricultural Research: A RAG-Based Approach to Mycorrhizal Fungi Information
di: Altam, Mohammad Usman, et al.
Pubblicazione: (2025)
di: Altam, Mohammad Usman, et al.
Pubblicazione: (2025)
To Redact, or not to Redact? A Local LLM Approach to Deliberative Process Privilege Classification
di: Larooij, Maik, et al.
Pubblicazione: (2026)
di: Larooij, Maik, et al.
Pubblicazione: (2026)
MMTEB: Massive Multilingual Text Embedding Benchmark
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2025)
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2025)
Perplexity Trap: PLM-Based Retrievers Overrate Low Perplexity Documents
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach
di: de Martim, Hudson
Pubblicazione: (2025)
di: de Martim, Hudson
Pubblicazione: (2025)
Benchmarking Advanced Text Anonymisation Methods: A Comparative Study on Novel and Traditional Approaches
di: Asimopoulos, Dimitris, et al.
Pubblicazione: (2024)
di: Asimopoulos, Dimitris, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems
di: Varangot-Reille, Clovis, et al.
Pubblicazione: (2025) -
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
di: Júnior, Paulo Roberto de Moura, et al.
Pubblicazione: (2026) -
Empirical Evaluation of PDF Parsing and Chunking for Financial Question Answering with RAG
di: Bachyr, Omar El, et al.
Pubblicazione: (2026) -
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
di: Zhang, Xuechen, et al.
Pubblicazione: (2025) -
Grounding Language Model with Chunking-Free In-Context Retrieval
di: Qian, Hongjin, et al.
Pubblicazione: (2024)