Chunk, Align, Select: A Simple Long-sequence Processing Method for Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Jiawen, Cheng, Pengyu, Liang, Xiao, Dai, Yong, Du, Nan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
par: Cheng, Pengyu, et autres
Publié: (2023)
par: Cheng, Pengyu, et autres
Publié: (2023)
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
par: Stankovic, Mile
Publié: (2025)
par: Stankovic, Mile
Publié: (2025)
Interdisciplinary Fairness in Imbalanced Research Proposal Topic Inference: A Hierarchical Transformer-based Method with Selective Interpolation
par: Xiao, Meng, et autres
Publié: (2023)
par: Xiao, Meng, et autres
Publié: (2023)
No Argument Left Behind: Overlapping Chunks for Faster Processing of Arbitrarily Long Legal Texts
par: Fama, Israel, et autres
Publié: (2024)
par: Fama, Israel, et autres
Publié: (2024)
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
par: Lu, Wensheng, et autres
Publié: (2025)
par: Lu, Wensheng, et autres
Publié: (2025)
MRG-R1: Reinforcement Learning for Clinically Aligned Medical Report Generation
par: Wang, Pengyu, et autres
Publié: (2025)
par: Wang, Pengyu, et autres
Publié: (2025)
Chunking German Legal Code
par: Prior, Max, et autres
Publié: (2026)
par: Prior, Max, et autres
Publié: (2026)
Chunk-Distilled Language Modeling
par: Li, Yanhong, et autres
Publié: (2024)
par: Li, Yanhong, et autres
Publié: (2024)
Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
par: Duan, Shaohua, et autres
Publié: (2025)
par: Duan, Shaohua, et autres
Publié: (2025)
MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents
par: Shin, Joongmin, et autres
Publié: (2026)
par: Shin, Joongmin, et autres
Publié: (2026)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
par: Liu, Xiaogeng, et autres
Publié: (2023)
par: Liu, Xiaogeng, et autres
Publié: (2023)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
par: Yang, Ningyuan, et autres
Publié: (2026)
par: Yang, Ningyuan, et autres
Publié: (2026)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
par: Wu, Kaifeng, et autres
Publié: (2025)
par: Wu, Kaifeng, et autres
Publié: (2025)
Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management
par: Wang, Yanan, et autres
Publié: (2026)
par: Wang, Yanan, et autres
Publié: (2026)
ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking
par: Ciancone, Mathieu, et autres
Publié: (2025)
par: Ciancone, Mathieu, et autres
Publié: (2025)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity
par: Shaukat, Muhammad Arslan, et autres
Publié: (2026)
par: Shaukat, Muhammad Arslan, et autres
Publié: (2026)
Simple Hack for Transformers against Heavy Long-Text Classification on a Time- and Memory-Limited GPU Service
par: Mutasodirin, Mirza Alim, et autres
Publié: (2024)
par: Mutasodirin, Mirza Alim, et autres
Publié: (2024)
LLM The Genius Paradox: A Linguistic and Math Expert's Struggle with Simple Word-based Counting Problems
par: Xu, Nan, et autres
Publié: (2024)
par: Xu, Nan, et autres
Publié: (2024)
Lissard: Long and Simple Sequential Reasoning Datasets
par: Bueno, Mirelle, et autres
Publié: (2024)
par: Bueno, Mirelle, et autres
Publié: (2024)
STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media
par: Xue, Liang, et autres
Publié: (2026)
par: Xue, Liang, et autres
Publié: (2026)
A New HOPE: Domain-agnostic Automatic Evaluation of Text Chunking
par: Brådland, Henrik, et autres
Publié: (2025)
par: Brådland, Henrik, et autres
Publié: (2025)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
par: Ouyang, Haojie, et autres
Publié: (2025)
par: Ouyang, Haojie, et autres
Publié: (2025)
Distribution-Aligned Decoding for Efficient LLM Task Adaptation
par: Hu, Senkang, et autres
Publié: (2025)
par: Hu, Senkang, et autres
Publié: (2025)
Knowing What LLMs DO NOT Know: A Simple Yet Effective Self-Detection Method
par: Zhao, Yukun, et autres
Publié: (2023)
par: Zhao, Yukun, et autres
Publié: (2023)
Enhancing Retrieval Augmented Generation with Hierarchical Text Segmentation Chunking
par: Nguyen, Hai Toan, et autres
Publié: (2025)
par: Nguyen, Hai Toan, et autres
Publié: (2025)
LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexing
par: Li, Dongfang, et autres
Publié: (2026)
par: Li, Dongfang, et autres
Publié: (2026)
Adapting to Non-Stationary Environments: Multi-Armed Bandit Enhanced Retrieval-Augmented Generation on Knowledge Graphs
par: Tang, Xiaqiang, et autres
Publié: (2024)
par: Tang, Xiaqiang, et autres
Publié: (2024)
Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale
par: Hu, Xiang, et autres
Publié: (2024)
par: Hu, Xiang, et autres
Publié: (2024)
Large Language Models Are Still Misled by Simple Bias Ensembles
par: Sun, Zhouhao, et autres
Publié: (2025)
par: Sun, Zhouhao, et autres
Publié: (2025)
Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs
par: Yu, Dongxing
Publié: (2025)
par: Yu, Dongxing
Publié: (2025)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
Advanced Unstructured Data Processing for ESG Reports: A Methodology for Structured Transformation and Enhanced Analysis
par: Peng, Jiahui, et autres
Publié: (2024)
par: Peng, Jiahui, et autres
Publié: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
par: Yuan, Jingyang, et autres
Publié: (2025)
par: Yuan, Jingyang, et autres
Publié: (2025)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
par: Yuan, Yurun, et autres
Publié: (2025)
par: Yuan, Yurun, et autres
Publié: (2025)
LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs -- No Silver Bullet for LC or RAG Routing
par: Li, Kuan, et autres
Publié: (2025)
par: Li, Kuan, et autres
Publié: (2025)
Atoxia: Red-teaming Large Language Models with Target Toxic Answers
par: Du, Yuhao, et autres
Publié: (2024)
par: Du, Yuhao, et autres
Publié: (2024)
SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels
par: Du, Guancheng, et autres
Publié: (2025)
par: Du, Guancheng, et autres
Publié: (2025)
Documents similaires
-
Adaptive Chunking: Optimizing Chunking-Method Selection for RAG
par: Júnior, Paulo Roberto de Moura, et autres
Publié: (2026) -
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
par: Cheng, Pengyu, et autres
Publié: (2023) -
Cross-Document Topic-Aligned Chunking for Retrieval-Augmented Generation
par: Stankovic, Mile
Publié: (2025) -
Interdisciplinary Fairness in Imbalanced Research Proposal Topic Inference: A Hierarchical Transformer-based Method with Selective Interpolation
par: Xiao, Meng, et autres
Publié: (2023) -
No Argument Left Behind: Overlapping Chunks for Faster Processing of Arbitrarily Long Legal Texts
par: Fama, Israel, et autres
Publié: (2024)