APE: Faster and Longer Context-Augmented Generation via Adaptive Parallel Encoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Xinyu, Chen, Tianqi, Chen, Beidi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
par: Yang, Xinyu, et autres
Publié: (2025)
par: Yang, Xinyu, et autres
Publié: (2025)
Reconciling In-Context and In-Weight Learning via Dual Representation Space Encoding
par: Chen, Guanyu, et autres
Publié: (2026)
par: Chen, Guanyu, et autres
Publié: (2026)
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
par: Zheng, Haizhong, et autres
Publié: (2025)
par: Zheng, Haizhong, et autres
Publié: (2025)
Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization
par: Chen, Hung-Hsuan
Publié: (2026)
par: Chen, Hung-Hsuan
Publié: (2026)
Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
S$^{2}$FT: Efficient, Scalable and Generalizable LLM Fine-tuning by Structured Sparsity
par: Yang, Xinyu, et autres
Publié: (2024)
par: Yang, Xinyu, et autres
Publié: (2024)
Train Faster, Perform Better: Modular Adaptive Training in Over-Parameterized Models
par: Shi, Yubin, et autres
Publié: (2024)
par: Shi, Yubin, et autres
Publié: (2024)
Unified Generation, Reconstruction, and Representation: Generalized Diffusion with Adaptive Latent Encoding-Decoding
par: Liu, Guangyi, et autres
Publié: (2024)
par: Liu, Guangyi, et autres
Publié: (2024)
Encoding Temporal Statistical-space Priors via Augmented Representation
par: Choi, Insu, et autres
Publié: (2024)
par: Choi, Insu, et autres
Publié: (2024)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
par: Zheng, Haizhong, et autres
Publié: (2025)
par: Zheng, Haizhong, et autres
Publié: (2025)
ContextFlow++: Generalist-Specialist Flow-based Generative Models with Mixed-Variable Context Encoding
par: Gudovskiy, Denis, et autres
Publié: (2024)
par: Gudovskiy, Denis, et autres
Publié: (2024)
APE: Selective Fine-tuning with Acceptance Criteria for Language Model Adaptation
par: Marín, Javier
Publié: (2025)
par: Marín, Javier
Publié: (2025)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
par: Tian, Yuandong, et autres
Publié: (2023)
par: Tian, Yuandong, et autres
Publié: (2023)
h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
par: Motwani, Sumeet Ramesh, et autres
Publié: (2025)
par: Motwani, Sumeet Ramesh, et autres
Publié: (2025)
SQLong: Enhanced NL2SQL for Longer Contexts with LLMs
par: Nguyen, Dai Quoc, et autres
Publié: (2025)
par: Nguyen, Dai Quoc, et autres
Publié: (2025)
FedLion: Faster Adaptive Federated Optimization with Fewer Communication
par: Tang, Zhiwei, et autres
Publié: (2024)
par: Tang, Zhiwei, et autres
Publié: (2024)
USP: A Unified Sequence Parallelism Approach for Long Context Generative AI
par: Fang, Jiarui, et autres
Publié: (2024)
par: Fang, Jiarui, et autres
Publié: (2024)
Parallel Structures in Pre-training Data Yield In-Context Learning
par: Chen, Yanda, et autres
Publié: (2024)
par: Chen, Yanda, et autres
Publié: (2024)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation
par: Li, Ruizhe, et autres
Publié: (2025)
par: Li, Ruizhe, et autres
Publié: (2025)
CiMRAG: CiM-Aware Domain-Adaptive and Noise-Resilient Retrieval-Augmented Generation for Edge-Based LLMs
par: Chiu, Shih-Hsuan, et autres
Publié: (2026)
par: Chiu, Shih-Hsuan, et autres
Publié: (2026)
SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training
par: Li, Zhouyang, et autres
Publié: (2025)
par: Li, Zhouyang, et autres
Publié: (2025)
Long-Context Attention Benchmark: From Kernel Efficiency to Distributed Context Parallelism
par: Bu, Tao, et autres
Publié: (2025)
par: Bu, Tao, et autres
Publié: (2025)
Efficient On-Device Agents via Adaptive Context Management
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
Rethinking Time Encoding via Learnable Transformation Functions
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
On Faster Marginalization with Squared Circuits via Orthonormalization
par: Loconte, Lorenzo, et autres
Publié: (2024)
par: Loconte, Lorenzo, et autres
Publié: (2024)
Extending Pretrained 10-Second ECG Foundation Models to Longer Horizons
par: Tang, Wei, et autres
Publié: (2026)
par: Tang, Wei, et autres
Publié: (2026)
SAFLEX: Self-Adaptive Augmentation via Feature Label Extrapolation
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
Near-Lossless Model Compression Enables Longer Context Inference in DNA Large Language Models
par: Zhu, Rui, et autres
Publié: (2025)
par: Zhu, Rui, et autres
Publié: (2025)
PID-controlled Langevin Dynamics for Faster Sampling of Generative Models
par: Chen, Hongyi, et autres
Publié: (2025)
par: Chen, Hongyi, et autres
Publié: (2025)
Question-Adaptive Graph Learning for Multi-hop Retrieval Augmented Generation
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
Towards Faster Training of Diffusion Models: An Inspiration of A Consistency Phenomenon
par: Xu, Tianshuo, et autres
Publié: (2024)
par: Xu, Tianshuo, et autres
Publié: (2024)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
par: Huang, Sili, et autres
Publié: (2024)
par: Huang, Sili, et autres
Publié: (2024)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
par: Guo, Wentao, et autres
Publié: (2024)
par: Guo, Wentao, et autres
Publié: (2024)
Generalized Parallel Scaling with Interdependent Generations
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
ATP: Adaptive Threshold Pruning for Efficient Data Encoding in Quantum Neural Networks
par: Afane, Mohamed, et autres
Publié: (2025)
par: Afane, Mohamed, et autres
Publié: (2025)
Documents similaires
-
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024) -
Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
par: Yang, Xinyu, et autres
Publié: (2025) -
Reconciling In-Context and In-Weight Learning via Dual Representation Space Encoding
par: Chen, Guanyu, et autres
Publié: (2026) -
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
par: Dong, Harry, et autres
Publié: (2024) -
SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation
par: Yang, Yuxin, et autres
Publié: (2026)