RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zihong, Li, Zuchao, Zhang, Lefei, Wang, Ping, Zhao, Hai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language Models
di: Zhang, Zihong, et al.
Pubblicazione: (2025)
di: Zhang, Zihong, et al.
Pubblicazione: (2025)
RASD: Retrieval-Augmented Speculative Decoding
di: Quan, Guofeng, et al.
Pubblicazione: (2025)
di: Quan, Guofeng, et al.
Pubblicazione: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
di: Song, Weixi, et al.
Pubblicazione: (2023)
di: Song, Weixi, et al.
Pubblicazione: (2023)
From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
di: Ma, Xiangyu, et al.
Pubblicazione: (2026)
di: Ma, Xiangyu, et al.
Pubblicazione: (2026)
Label Drop for Multi-Aspect Relation Modeling in Universal Information Extraction
di: Yang, Lu, et al.
Pubblicazione: (2025)
di: Yang, Lu, et al.
Pubblicazione: (2025)
Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
di: Shi, Luohe, et al.
Pubblicazione: (2025)
di: Shi, Luohe, et al.
Pubblicazione: (2025)
Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models
di: Shi, Luohe, et al.
Pubblicazione: (2024)
di: Shi, Luohe, et al.
Pubblicazione: (2024)
When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
di: Fang, Min, et al.
Pubblicazione: (2025)
di: Fang, Min, et al.
Pubblicazione: (2025)
Speculative Decoding for Multi-Sample Inference
di: Li, Yiwei, et al.
Pubblicazione: (2025)
di: Li, Yiwei, et al.
Pubblicazione: (2025)
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
di: Wang, Zilong, et al.
Pubblicazione: (2024)
di: Wang, Zilong, et al.
Pubblicazione: (2024)
Batch Speculative Decoding Done Right
di: Zhang, Ranran Haoran, et al.
Pubblicazione: (2025)
di: Zhang, Ranran Haoran, et al.
Pubblicazione: (2025)
Scaling Laws for Speculative Decoding
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
Multi-modal Auto-regressive Modeling via Visual Words
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
CREST: Effectively Compacting a Datastore For Retrieval-Based Speculative Decoding
di: Ho, Sophia, et al.
Pubblicazione: (2024)
di: Ho, Sophia, et al.
Pubblicazione: (2024)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
Cross-Attention Speculative Decoding
di: Zhong, Wei, et al.
Pubblicazione: (2025)
di: Zhong, Wei, et al.
Pubblicazione: (2025)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
di: Brown, Oscar, et al.
Pubblicazione: (2024)
di: Brown, Oscar, et al.
Pubblicazione: (2024)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
REST: Retrieval-Based Speculative Decoding
di: He, Zhenyu, et al.
Pubblicazione: (2023)
di: He, Zhenyu, et al.
Pubblicazione: (2023)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
di: Li, Guanghao, et al.
Pubblicazione: (2025)
di: Li, Guanghao, et al.
Pubblicazione: (2025)
The Disparate Impacts of Speculative Decoding
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
Constrained Decoding with Speculative Lookaheads
di: Nakshatri, Nishanth, et al.
Pubblicazione: (2024)
di: Nakshatri, Nishanth, et al.
Pubblicazione: (2024)
Speculative Decoding: Performance or Illusion?
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
Mamba Drafters for Speculative Decoding
di: Choi, Daewon, et al.
Pubblicazione: (2025)
di: Choi, Daewon, et al.
Pubblicazione: (2025)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
di: Jin, Tao, et al.
Pubblicazione: (2026)
di: Jin, Tao, et al.
Pubblicazione: (2026)
LFD: Layer Fused Decoding to Exploit External Knowledge in Retrieval-Augmented Generation
di: Sun, Yang, et al.
Pubblicazione: (2025)
di: Sun, Yang, et al.
Pubblicazione: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
di: Ma, Zhiyao, et al.
Pubblicazione: (2025)
di: Ma, Zhiyao, et al.
Pubblicazione: (2025)
A Coin Has Two Sides: A Novel Detector-Corrector Framework for Chinese Spelling Correction
di: Zeng, Xiangke, et al.
Pubblicazione: (2024)
di: Zeng, Xiangke, et al.
Pubblicazione: (2024)
SENSE: Semantic Embedding Navigation with Soft-gated Evaluation for Retrieval-based Speculative Decoding
di: Chen, Shaowen, et al.
Pubblicazione: (2026)
di: Chen, Shaowen, et al.
Pubblicazione: (2026)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
di: Su, Xin, et al.
Pubblicazione: (2026)
di: Su, Xin, et al.
Pubblicazione: (2026)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
di: Corallo, Giulio, et al.
Pubblicazione: (2026)
di: Corallo, Giulio, et al.
Pubblicazione: (2026)
Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
di: Li, Ruanjun, et al.
Pubblicazione: (2025)
di: Li, Ruanjun, et al.
Pubblicazione: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
di: Liao, Baohao, et al.
Pubblicazione: (2025)
di: Liao, Baohao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language Models
di: Zhang, Zihong, et al.
Pubblicazione: (2025) -
RASD: Retrieval-Augmented Speculative Decoding
di: Quan, Guofeng, et al.
Pubblicazione: (2025) -
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025) -
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
di: Song, Weixi, et al.
Pubblicazione: (2023) -
From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
di: Ma, Xiangyu, et al.
Pubblicazione: (2026)