TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Tianyu, Lv, Qitan, Shen, Yuhao, Sun, Xiao, Sun, Xiaoyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
por: Liu, Tianyu, et al.
Publicado: (2025)
por: Liu, Tianyu, et al.
Publicado: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024)
por: Liu, Tianyu, et al.
Publicado: (2024)
Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
por: Jiang, Jie, et al.
Publicado: (2026)
por: Jiang, Jie, et al.
Publicado: (2026)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024)
por: Liu, Chengbo, et al.
Publicado: (2024)
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
por: Pan, Lehan, et al.
Publicado: (2026)
por: Pan, Lehan, et al.
Publicado: (2026)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
por: Ziashahabi, Amir, et al.
Publicado: (2025)
por: Ziashahabi, Amir, et al.
Publicado: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
por: Amer, Walaa, et al.
Publicado: (2026)
por: Amer, Walaa, et al.
Publicado: (2026)
From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning
por: Purohit, Kiran, et al.
Publicado: (2026)
por: Purohit, Kiran, et al.
Publicado: (2026)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
por: Zhang, Shuai, et al.
Publicado: (2026)
por: Zhang, Shuai, et al.
Publicado: (2026)
Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism
por: Shen, Yuhao, et al.
Publicado: (2026)
por: Shen, Yuhao, et al.
Publicado: (2026)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
por: Wang, Jikai, et al.
Publicado: (2024)
por: Wang, Jikai, et al.
Publicado: (2024)
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
por: Lv, Qitan, et al.
Publicado: (2026)
por: Lv, Qitan, et al.
Publicado: (2026)
When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?
por: Liu, Tianyu, et al.
Publicado: (2026)
por: Liu, Tianyu, et al.
Publicado: (2026)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
por: Gautam, Aayush, et al.
Publicado: (2025)
por: Gautam, Aayush, et al.
Publicado: (2025)
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
por: Dong, Ximing, et al.
Publicado: (2026)
por: Dong, Ximing, et al.
Publicado: (2026)
Confidence-Modulated Speculative Decoding for Large Language Models
por: Sen, Jaydip, et al.
Publicado: (2025)
por: Sen, Jaydip, et al.
Publicado: (2025)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
por: Lee, Jeongtae, et al.
Publicado: (2026)
por: Lee, Jeongtae, et al.
Publicado: (2026)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
por: Xiao, Sibo, et al.
Publicado: (2025)
por: Xiao, Sibo, et al.
Publicado: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
por: Huang, Kaiyu, et al.
Publicado: (2025)
por: Huang, Kaiyu, et al.
Publicado: (2025)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
por: Lv, Qitan, et al.
Publicado: (2026)
por: Lv, Qitan, et al.
Publicado: (2026)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
por: Zhao, Weilin, et al.
Publicado: (2024)
por: Zhao, Weilin, et al.
Publicado: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
por: Lv, Kai, et al.
Publicado: (2025)
por: Lv, Kai, et al.
Publicado: (2025)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism
por: Shen, Yuhao, et al.
Publicado: (2025)
por: Shen, Yuhao, et al.
Publicado: (2025)
Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models
por: Chen, Kecheng, et al.
Publicado: (2025)
por: Chen, Kecheng, et al.
Publicado: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
por: Wang, Jikai, et al.
Publicado: (2025)
por: Wang, Jikai, et al.
Publicado: (2025)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
por: Sun, Shuoyang, et al.
Publicado: (2026)
por: Sun, Shuoyang, et al.
Publicado: (2026)
C2T: A Classifier-Based Tree Construction Method in Speculative Decoding
por: Huo, Feiye, et al.
Publicado: (2025)
por: Huo, Feiye, et al.
Publicado: (2025)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
por: Shukla, Shikhar
Publicado: (2026)
por: Shukla, Shikhar
Publicado: (2026)
Graph-Structured Speculative Decoding
por: Gong, Zhuocheng, et al.
Publicado: (2024)
por: Gong, Zhuocheng, et al.
Publicado: (2024)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
por: Jin, Tao, et al.
Publicado: (2026)
por: Jin, Tao, et al.
Publicado: (2026)
Speculative Contrastive Decoding
por: Yuan, Hongyi, et al.
Publicado: (2023)
por: Yuan, Hongyi, et al.
Publicado: (2023)
Fast Best-of-N Decoding via Speculative Rejection
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
por: Sun, Chendong, et al.
Publicado: (2025)
por: Sun, Chendong, et al.
Publicado: (2025)
Ejemplares similares
-
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
por: Liu, Tianyu, et al.
Publicado: (2025) -
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
por: Liu, Tianyu, et al.
Publicado: (2024) -
Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
por: Jiang, Jie, et al.
Publicado: (2026) -
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024) -
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
por: Pan, Lehan, et al.
Publicado: (2026)