Cross-Family Speculative Prefill: Training-Free Long-Context Compression with Small Draft Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Upasani, Shubhangi, Raju, Ravi Shanker, Li, Bo, Ji, Mengmeng, Long, John, Wu, Chen, Thakker, Urmish, Wang, Guangtao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Limits of Long-Context Reasoning in Automated Bug Fixing
par: Raju, Ravi, et autres
Publié: (2026)
par: Raju, Ravi, et autres
Publié: (2026)
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
par: Ji, Mengmeng, et autres
Publié: (2026)
par: Ji, Mengmeng, et autres
Publié: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025)
par: Hong, Fenglu, et autres
Publié: (2025)
Test-Time Adaptation via Many-Shot Prompting: Benefits, Limits, and Pitfalls
par: Upasani, Shubhangi, et autres
Publié: (2026)
par: Upasani, Shubhangi, et autres
Publié: (2026)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
par: Zhang, Qizheng, et autres
Publié: (2025)
par: Zhang, Qizheng, et autres
Publié: (2025)
Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge
par: Raju, Ravi, et autres
Publié: (2024)
par: Raju, Ravi, et autres
Publié: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
par: Li, Jonathan, et autres
Publié: (2025)
par: Li, Jonathan, et autres
Publié: (2025)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025)
par: Liu, Jingyu, et autres
Publié: (2025)
FlashPrefill: Instantaneous Pattern Discovery and Thresholding for Ultra-Fast Long-Context Prefilling
par: Fan, Qihang, et autres
Publié: (2026)
par: Fan, Qihang, et autres
Publié: (2026)
UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification
par: Fan, Qihang, et autres
Publié: (2026)
par: Fan, Qihang, et autres
Publié: (2026)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
par: Zhao, Xueliang, et autres
Publié: (2024)
par: Zhao, Xueliang, et autres
Publié: (2024)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
par: Jayanth, Rakshith, et autres
Publié: (2026)
par: Jayanth, Rakshith, et autres
Publié: (2026)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
par: Hu, Pengfei, et autres
Publié: (2025)
par: Hu, Pengfei, et autres
Publié: (2025)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
par: Li, Jinze, et autres
Publié: (2025)
par: Li, Jinze, et autres
Publié: (2025)
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
par: Bhansali, Shrenik, et autres
Publié: (2025)
par: Bhansali, Shrenik, et autres
Publié: (2025)
Flatter Tokens are More Valuable for Speculative Draft Model Training
par: Fan, Jiaming, et autres
Publié: (2026)
par: Fan, Jiaming, et autres
Publié: (2026)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
par: Lei, Haodi, et autres
Publié: (2026)
par: Lei, Haodi, et autres
Publié: (2026)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
par: Wu, Tianyu, et autres
Publié: (2026)
par: Wu, Tianyu, et autres
Publié: (2026)
GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
par: Peng, Junjie, et autres
Publié: (2026)
par: Peng, Junjie, et autres
Publié: (2026)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
par: Xue, Zhiyu, et autres
Publié: (2024)
par: Xue, Zhiyu, et autres
Publié: (2024)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
Simopt -- Simulation pass for Speculative Optimisation of FPGA-CAD flow
par: Wadhwa, Eashan, et autres
Publié: (2024)
par: Wadhwa, Eashan, et autres
Publié: (2024)
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
par: Pan, Rui, et autres
Publié: (2025)
par: Pan, Rui, et autres
Publié: (2025)
Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing
par: Peng, Dan, et autres
Publié: (2025)
par: Peng, Dan, et autres
Publié: (2025)
DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
par: Xu, Yuhang, et autres
Publié: (2026)
par: Xu, Yuhang, et autres
Publié: (2026)
Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility
par: Oh, Jungsuk, et autres
Publié: (2026)
par: Oh, Jungsuk, et autres
Publié: (2026)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
When Drafts Evolve: Speculative Decoding Meets Online Learning
par: Qian, Yu-Yang, et autres
Publié: (2026)
par: Qian, Yu-Yang, et autres
Publié: (2026)
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
par: He, Liang, et autres
Publié: (2026)
par: He, Liang, et autres
Publié: (2026)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
par: Guanzhong, Chen
Publié: (2026)
par: Guanzhong, Chen
Publié: (2026)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Synthetic Document Question Answering in Hungarian
par: Li, Jonathan, et autres
Publié: (2025)
par: Li, Jonathan, et autres
Publié: (2025)
Perception Compressor: A Training-Free Prompt Compression Framework in Long Context Scenarios
par: Tang, Jiwei, et autres
Publié: (2024)
par: Tang, Jiwei, et autres
Publié: (2024)
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
par: Liu, Zining, et autres
Publié: (2026)
par: Liu, Zining, et autres
Publié: (2026)
Documents similaires
-
The Limits of Long-Context Reasoning in Automated Bug Fixing
par: Raju, Ravi, et autres
Publié: (2026) -
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
par: Ji, Mengmeng, et autres
Publié: (2026) -
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025) -
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025) -
Test-Time Adaptation via Many-Shot Prompting: Benefits, Limits, and Pitfalls
par: Upasani, Shubhangi, et autres
Publié: (2026)