Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeoff
Fuente:
arXiv
Guardado en:
| Autores principales: | Holsman, Maximilian, Huang, Yukun, Dhingra, Bhuwan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Real-time Factuality Assessment from Adversarial Feedback
por: Chen, Sanxing, et al.
Publicado: (2024)
por: Chen, Sanxing, et al.
Publicado: (2024)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
por: Huang, Yukun, et al.
Publicado: (2024)
por: Huang, Yukun, et al.
Publicado: (2024)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2024)
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
por: Huang, Yukun, et al.
Publicado: (2025)
por: Huang, Yukun, et al.
Publicado: (2025)
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
por: Chen, Sanxing, et al.
Publicado: (2025)
por: Chen, Sanxing, et al.
Publicado: (2025)
Calibrating Long-form Generations from Large Language Models
por: Huang, Yukun, et al.
Publicado: (2024)
por: Huang, Yukun, et al.
Publicado: (2024)
DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
por: Huang, Yukun, et al.
Publicado: (2026)
por: Huang, Yukun, et al.
Publicado: (2026)
Adversarial Math Word Problem Generation
por: Xie, Roy, et al.
Publicado: (2024)
por: Xie, Roy, et al.
Publicado: (2024)
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
por: Cai, Hongyi James, et al.
Publicado: (2025)
por: Cai, Hongyi James, et al.
Publicado: (2025)
Hierarchical Multi-Label Classification of Online Vaccine Concerns
por: Zhu, Chloe Qinyu, et al.
Publicado: (2024)
por: Zhu, Chloe Qinyu, et al.
Publicado: (2024)
Coding Agents are Effective Long-Context Processors
por: Cao, Weili, et al.
Publicado: (2026)
por: Cao, Weili, et al.
Publicado: (2026)
Document-as-Image Representations Fall Short for Scientific Retrieval
por: Khalighinejad, Ghazal, et al.
Publicado: (2026)
por: Khalighinejad, Ghazal, et al.
Publicado: (2026)
Generalizability of Large Language Model-Based Agents: A Comprehensive Survey
por: Zhang, Minxing, et al.
Publicado: (2025)
por: Zhang, Minxing, et al.
Publicado: (2025)
Atomic Self-Consistency for Better Long Form Generations
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2024)
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2024)
The Price of Freedom: Exploring Expressivity and Runtime Tradeoffs in Equivariant Tensor Products
por: Xie, YuQing, et al.
Publicado: (2025)
por: Xie, YuQing, et al.
Publicado: (2025)
Staircase Streaming for Low-Latency Multi-Agent Inference
por: Wang, Junlin, et al.
Publicado: (2025)
por: Wang, Junlin, et al.
Publicado: (2025)
Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding
por: Zhou, Yuxuan, et al.
Publicado: (2026)
por: Zhou, Yuxuan, et al.
Publicado: (2026)
The Disparate Impacts of Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Cross-Attention Speculative Decoding
por: Zhong, Wei, et al.
Publicado: (2025)
por: Zhong, Wei, et al.
Publicado: (2025)
Speculative Decoding: Performance or Illusion?
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Speculative Safety-Aware Decoding
por: Wang, Xuekang, et al.
Publicado: (2025)
por: Wang, Xuekang, et al.
Publicado: (2025)
Constrained Decoding with Speculative Lookaheads
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
por: Jin, Tao, et al.
Publicado: (2026)
por: Jin, Tao, et al.
Publicado: (2026)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
por: Wang, Zhuoyu, et al.
Publicado: (2026)
por: Wang, Zhuoyu, et al.
Publicado: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
Over-Searching in Search-Augmented Large Language Models
por: Xie, Roy, et al.
Publicado: (2026)
por: Xie, Roy, et al.
Publicado: (2026)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
por: Su, Xin, et al.
Publicado: (2026)
por: Su, Xin, et al.
Publicado: (2026)
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024)
por: Zimmer, Matthieu, et al.
Publicado: (2024)
Reinforcement Speculative Decoding for Fast Ranking
por: Du, Yingpeng, et al.
Publicado: (2025)
por: Du, Yingpeng, et al.
Publicado: (2025)
Intrinsic Fairness-Accuracy Tradeoffs under Equalized Odds
por: Zhong, Meiyu, et al.
Publicado: (2024)
por: Zhong, Meiyu, et al.
Publicado: (2024)
QSpec: Speculative Decoding with Complementary Quantization Schemes
por: Zhao, Juntao, et al.
Publicado: (2024)
por: Zhao, Juntao, et al.
Publicado: (2024)
Ejemplares similares
-
Real-time Factuality Assessment from Adversarial Feedback
por: Chen, Sanxing, et al.
Publicado: (2024) -
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
por: Huang, Yukun, et al.
Publicado: (2024) -
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2024) -
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
por: Huang, Yukun, et al.
Publicado: (2025) -
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
por: Chen, Sanxing, et al.
Publicado: (2025)