RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Guanzheng, Feng, Qilong, Ni, Jinjie, Li, Xin, Shieh, Michael Qizhe |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026)
par: Chen, Guanzheng, et autres
Publié: (2026)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
par: Chen, Guanzheng, et autres
Publié: (2025)
par: Chen, Guanzheng, et autres
Publié: (2025)
RASD: Retrieval-Augmented Speculative Decoding
par: Quan, Guofeng, et autres
Publié: (2025)
par: Quan, Guofeng, et autres
Publié: (2025)
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
RAPID: Retrieval-Augmented Parallel Inference Drafting for Text-Based Video Event Retrieval
par: Nguyen, Long, et autres
Publié: (2025)
par: Nguyen, Long, et autres
Publié: (2025)
Inference Scaling for Long-Context Retrieval Augmented Generation
par: Yue, Zhenrui, et autres
Publié: (2024)
par: Yue, Zhenrui, et autres
Publié: (2024)
RAPID: Efficient Retrieval-Augmented Long Text Generation with Writing Planning and Information Discovery
par: Gu, Hongchao, et autres
Publié: (2025)
par: Gu, Hongchao, et autres
Publié: (2025)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
par: Zhang, Zihong, et autres
Publié: (2026)
par: Zhang, Zihong, et autres
Publié: (2026)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Training Optimal Large Diffusion Language Models
par: Ni, Jinjie, et autres
Publié: (2025)
par: Ni, Jinjie, et autres
Publié: (2025)
MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding
par: Sadhukhan, Ranajoy, et autres
Publié: (2024)
par: Sadhukhan, Ranajoy, et autres
Publié: (2024)
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
par: Xia, Heming, et autres
Publié: (2026)
par: Xia, Heming, et autres
Publié: (2026)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
FlashBack:Efficient Retrieval-Augmented Language Modeling for Long Context Inference
par: Liu, Runheng, et autres
Publié: (2024)
par: Liu, Runheng, et autres
Publié: (2024)
DReSD: Dense Retrieval for Speculative Decoding
par: Gritta, Milan, et autres
Publié: (2025)
par: Gritta, Milan, et autres
Publié: (2025)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
par: Liu, Fuliang, et autres
Publié: (2026)
par: Liu, Fuliang, et autres
Publié: (2026)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
par: Xia, Heming, et autres
Publié: (2024)
par: Xia, Heming, et autres
Publié: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation
par: Chen, Jiamin, et autres
Publié: (2025)
par: Chen, Jiamin, et autres
Publié: (2025)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
par: Lee, Jaeseong, et autres
Publié: (2025)
par: Lee, Jaeseong, et autres
Publié: (2025)
Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
Speculative Decoding with a Speculative Vocabulary
par: Williams, Miles, et autres
Publié: (2026)
par: Williams, Miles, et autres
Publié: (2026)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
par: Chen, Longze, et autres
Publié: (2025)
par: Chen, Longze, et autres
Publié: (2025)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026)
par: Lin, Gang, et autres
Publié: (2026)
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
par: Corallo, Giulio, et autres
Publié: (2026)
par: Corallo, Giulio, et autres
Publié: (2026)
NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies
par: Chen, Zhiyang, et autres
Publié: (2026)
par: Chen, Zhiyang, et autres
Publié: (2026)
Accelerating Inference of Retrieval-Augmented Generation via Sparse Context Selection
par: Zhu, Yun, et autres
Publié: (2024)
par: Zhu, Yun, et autres
Publié: (2024)
Adaptive Contrastive Decoding in Retrieval-Augmented Generation for Handling Noisy Contexts
par: Kim, Youna, et autres
Publié: (2024)
par: Kim, Youna, et autres
Publié: (2024)
Unnatural Languages Are Not Bugs but Features for LLMs
par: Duan, Keyu, et autres
Publié: (2025)
par: Duan, Keyu, et autres
Publié: (2025)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
par: Bhendawade, Nikhil, et autres
Publié: (2025)
par: Bhendawade, Nikhil, et autres
Publié: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding
par: Li, Yuqing, et autres
Publié: (2025)
par: Li, Yuqing, et autres
Publié: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
par: Liu, Xiangyan, et autres
Publié: (2025)
par: Liu, Xiangyan, et autres
Publié: (2025)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
par: Li, Ruixiao, et autres
Publié: (2025)
par: Li, Ruixiao, et autres
Publié: (2025)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
par: Svirschevski, Ruslan, et autres
Publié: (2024)
par: Svirschevski, Ruslan, et autres
Publié: (2024)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
ZigzagAttention: Efficient Long-Context Inference with Exclusive Retrieval and Streaming Heads
par: Liu, Zhuorui, et autres
Publié: (2025)
par: Liu, Zhuorui, et autres
Publié: (2025)
Documents similaires
-
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026) -
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
par: Chen, Guanzheng, et autres
Publié: (2025) -
RASD: Retrieval-Augmented Speculative Decoding
par: Quan, Guofeng, et autres
Publié: (2025) -
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
par: Wu, Zijian, et autres
Publié: (2025) -
RAPID: Retrieval-Augmented Parallel Inference Drafting for Text-Based Video Event Retrieval
par: Nguyen, Long, et autres
Publié: (2025)