Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Kaifeng, Wu, Junyan, Liu, Qiang, Zhang, Jiarui, Xu, Wen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
par: Stankovic, Mile
Publié: (2025)
par: Stankovic, Mile
Publié: (2025)
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
DiVA-DocRE: A Discriminative and Voice-Aware Paradigm for Document-Level Relation Extraction
par: Wu, Yiheng, et autres
Publié: (2024)
par: Wu, Yiheng, et autres
Publié: (2024)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
par: Zhang, Xuechen, et autres
Publié: (2025)
par: Zhang, Xuechen, et autres
Publié: (2025)
ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking
par: Ciancone, Mathieu, et autres
Publié: (2025)
par: Ciancone, Mathieu, et autres
Publié: (2025)
Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering
par: Maharjan, Anuj, et autres
Publié: (2026)
par: Maharjan, Anuj, et autres
Publié: (2026)
Reconstructing Context: Evaluating Advanced Chunking Strategies for Retrieval-Augmented Generation
par: Merola, Carlo, et autres
Publié: (2025)
par: Merola, Carlo, et autres
Publié: (2025)
Grounding Language Model with Chunking-Free In-Context Retrieval
par: Qian, Hongjin, et autres
Publié: (2024)
par: Qian, Hongjin, et autres
Publié: (2024)
Advancing Event Causality Identification via Heuristic Semantic Dependency Inquiry Network
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
The Chronicles of RAG: The Retriever, the Chunk and the Generator
par: Finardi, Paulo, et autres
Publié: (2024)
par: Finardi, Paulo, et autres
Publié: (2024)
cAST: Enhancing Code Retrieval-Augmented Generation with Structural Chunking via Abstract Syntax Tree
par: Zhang, Yilin, et autres
Publié: (2025)
par: Zhang, Yilin, et autres
Publié: (2025)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
par: Wu, Hui, et autres
Publié: (2026)
par: Wu, Hui, et autres
Publié: (2026)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
par: Su, Weihang, et autres
Publié: (2025)
par: Su, Weihang, et autres
Publié: (2025)
S-Path-RAG: Semantic-Aware Shortest-Path Retrieval Augmented Generation for Multi-Hop Knowledge Graph Question Answering
par: Fu, Rong, et autres
Publié: (2026)
par: Fu, Rong, et autres
Publié: (2026)
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
par: Su, Weihang, et autres
Publié: (2026)
par: Su, Weihang, et autres
Publié: (2026)
Phonetically-Augmented Discriminative Rescoring for Voice Search Error Correction
par: Van Gysel, Christophe, et autres
Publié: (2025)
par: Van Gysel, Christophe, et autres
Publié: (2025)
SEFD: Semantic-Enhanced Framework for Detecting LLM-Generated Text
par: He, Weiqing, et autres
Publié: (2024)
par: He, Weiqing, et autres
Publié: (2024)
Neural Retrievers are Biased Towards LLM-Generated Content
par: Dai, Sunhao, et autres
Publié: (2023)
par: Dai, Sunhao, et autres
Publié: (2023)
Stealthy Attack on Large Language Model based Recommendation
par: Zhang, Jinghao, et autres
Publié: (2024)
par: Zhang, Jinghao, et autres
Publié: (2024)
GOLFer: Smaller LM-Generated Documents Hallucination Filter & Combiner for Query Expansion in Information Retrieval
par: Liu, Lingyuan, et autres
Publié: (2025)
par: Liu, Lingyuan, et autres
Publié: (2025)
HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches
par: Tan, Jiejun, et autres
Publié: (2025)
par: Tan, Jiejun, et autres
Publié: (2025)
Clinical Document Metadata Extraction: A Scoping Review
par: Miller, Kurt, et autres
Publié: (2025)
par: Miller, Kurt, et autres
Publié: (2025)
Structured Attention Matters to Multimodal LLMs in Document Understanding
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models
par: Sun, Qiang, et autres
Publié: (2024)
par: Sun, Qiang, et autres
Publié: (2024)
Tuning LLMs by RAG Principles: Towards LLM-native Memory
par: Wei, Jiale, et autres
Publié: (2025)
par: Wei, Jiale, et autres
Publié: (2025)
Event GDR: Event-Centric Generative Document Retrieval
par: Guan, Yong, et autres
Publié: (2024)
par: Guan, Yong, et autres
Publié: (2024)
Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning
par: Sun, Yiqun, et autres
Publié: (2025)
par: Sun, Yiqun, et autres
Publié: (2025)
Doc2SAR: A Synergistic Framework for High-Fidelity Extraction of Structure-Activity Relationships from Scientific Documents
par: Zhuang, Jiaxi, et autres
Publié: (2025)
par: Zhuang, Jiaxi, et autres
Publié: (2025)
Perplexity Trap: PLM-Based Retrievers Overrate Low Perplexity Documents
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents
par: Kim, Sungmoon, et autres
Publié: (2025)
par: Kim, Sungmoon, et autres
Publié: (2025)
Agentic Chunking and Bayesian De-chunking of AI Generated Fuzzy Cognitive Maps: A Model of the Thucydides Trap
par: Panda, Akash Kumar, et autres
Publié: (2026)
par: Panda, Akash Kumar, et autres
Publié: (2026)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
par: Su, Weihang, et autres
Publié: (2025)
par: Su, Weihang, et autres
Publié: (2025)
Reasoning-Enhanced Self-Training for Long-Form Personalized Text Generation
par: Salemi, Alireza, et autres
Publié: (2025)
par: Salemi, Alireza, et autres
Publié: (2025)
Semantic Convergence: Harmonizing Recommender Systems via Two-Stage Alignment and Behavioral Semantic Tokenization
par: Li, Guanghan, et autres
Publié: (2024)
par: Li, Guanghan, et autres
Publié: (2024)
Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI
par: Singh, Saurabh K., et autres
Publié: (2026)
par: Singh, Saurabh K., et autres
Publié: (2026)
Think Before Recommend: Unleashing the Latent Reasoning Power for Sequential Recommendation
par: Tang, Jiakai, et autres
Publié: (2025)
par: Tang, Jiakai, et autres
Publié: (2025)
SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets
par: Zheng, Xu, et autres
Publié: (2026)
par: Zheng, Xu, et autres
Publié: (2026)
GenCRF: Generative Clustering and Reformulation Framework for Enhanced Intent-Driven Information Retrieval
par: Seo, Wonduk, et autres
Publié: (2024)
par: Seo, Wonduk, et autres
Publié: (2024)
LongKey: Keyphrase Extraction for Long Documents
par: Alves, Jeovane Honorio, et autres
Publié: (2024)
par: Alves, Jeovane Honorio, et autres
Publié: (2024)
Documents similaires
-
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025) -
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
par: Stankovic, Mile
Publié: (2025) -
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026) -
DiVA-DocRE: A Discriminative and Voice-Aware Paradigm for Document-Level Relation Extraction
par: Wu, Yiheng, et autres
Publié: (2024) -
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
par: Zhang, Xuechen, et autres
Publié: (2025)