Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Shengyin, Li, Yiming, Li, Xing, Lian, Yingzhao, Lin, Weizhe, Zhen, Hui-Ling, Yang, Zhiyuan, Chen, Chen, Yu, Xianzhi, Yuan, Mingxuan, Ma, Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026)
par: Sun, Shengyin, et autres
Publié: (2026)
Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
par: Sun, Shengyin, et autres
Publié: (2026)
par: Sun, Shengyin, et autres
Publié: (2026)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Iterative Deepening Sampling as Efficient Test-Time Scaling
par: Chen, Weizhe, et autres
Publié: (2025)
par: Chen, Weizhe, et autres
Publié: (2025)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
DiLA: Enhancing LLM Tool Learning with Differential Logic Layer
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
par: Yankun, Hong, et autres
Publié: (2025)
par: Yankun, Hong, et autres
Publié: (2025)
SwiftMem: Fast Agentic Memory via Query-aware Indexing
par: Tian, Anxin, et autres
Publié: (2026)
par: Tian, Anxin, et autres
Publié: (2026)
PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers
par: Lin, Weizhe, et autres
Publié: (2024)
par: Lin, Weizhe, et autres
Publié: (2024)
Towards Efficient Agents: A Co-Design of Inference Architecture and System
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
LESA: Learnable LLM Layer Scaling-Up
par: Yang, Yifei, et autres
Publié: (2025)
par: Yang, Yifei, et autres
Publié: (2025)
What Matters For Safety Alignment?
par: Li, Xing, et autres
Publié: (2026)
par: Li, Xing, et autres
Publié: (2026)
AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding
par: Luo, Shuqing, et autres
Publié: (2025)
par: Luo, Shuqing, et autres
Publié: (2025)
Scaling Up Dynamic Human-Scene Interaction Modeling
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Enhanced Pre-training of Graph Neural Networks for Million-Scale Heterogeneous Graphs
par: Sun, Shengyin, et autres
Publié: (2025)
par: Sun, Shengyin, et autres
Publié: (2025)
Behavioral Fingerprinting of Large Language Models
par: Pei, Zehua, et autres
Publié: (2025)
par: Pei, Zehua, et autres
Publié: (2025)
From Scale to Speed: Adaptive Test-Time Scaling for Image Editing
par: Qu, Xiangyan, et autres
Publié: (2026)
par: Qu, Xiangyan, et autres
Publié: (2026)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
RTLRewriter: Methodologies for Large Models aided RTL Code Optimization
par: Yao, Xufeng, et autres
Publié: (2024)
par: Yao, Xufeng, et autres
Publié: (2024)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
par: Liu, Xing, et autres
Publié: (2025)
par: Liu, Xing, et autres
Publié: (2025)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
par: Tang, Bangsheng, et autres
Publié: (2025)
par: Tang, Bangsheng, et autres
Publié: (2025)
AquilaMoE: Efficient Training for MoE Models with Scale-Up and Scale-Out Strategies
par: Zhang, Bo-Wen, et autres
Publié: (2024)
par: Zhang, Bo-Wen, et autres
Publié: (2024)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
par: Huang, Zhongzhan, et autres
Publié: (2025)
par: Huang, Zhongzhan, et autres
Publié: (2025)
SeaDAG: Semi-autoregressive Diffusion for Conditional Directed Acyclic Graph Generation
par: Zhou, Xinyi, et autres
Publié: (2024)
par: Zhou, Xinyi, et autres
Publié: (2024)
Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
par: Shi, Luohe, et autres
Publié: (2025)
par: Shi, Luohe, et autres
Publié: (2025)
Benchmark Test-Time Scaling of General LLM Agents
par: Li, Xiaochuan, et autres
Publié: (2026)
par: Li, Xiaochuan, et autres
Publié: (2026)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
Scaling Up Active Testing to Large Language Models
par: Berrada, Gabrielle, et autres
Publié: (2025)
par: Berrada, Gabrielle, et autres
Publié: (2025)
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
par: Zhao, Pengxiang, et autres
Publié: (2026)
par: Zhao, Pengxiang, et autres
Publié: (2026)
An Empirical Study of Speculative Decoding on Software Engineering Tasks
par: Li, Yijia, et autres
Publié: (2026)
par: Li, Yijia, et autres
Publié: (2026)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
par: Li, Ruixiao, et autres
Publié: (2025)
par: Li, Ruixiao, et autres
Publié: (2025)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
par: Li, Minghan, et autres
Publié: (2024)
par: Li, Minghan, et autres
Publié: (2024)
Scaling Up LLM Reviews for Google Ads Content Moderation
par: Qiao, Wei, et autres
Publié: (2024)
par: Qiao, Wei, et autres
Publié: (2024)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
par: Zeng, Zhiyuan, et autres
Publié: (2025)
par: Zeng, Zhiyuan, et autres
Publié: (2025)
SolverLLM: Leveraging Test-Time Scaling for Optimization Problem via LLM-Guided Search
par: Li, Dong, et autres
Publié: (2025)
par: Li, Dong, et autres
Publié: (2025)
Up to Speed on DVD.
par: Crawford, Walt
Publié: (1999)
par: Crawford, Walt
Publié: (1999)
SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
Documents similaires
-
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026) -
Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
par: Sun, Shengyin, et autres
Publié: (2026) -
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025) -
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
par: Zhang, Jiebin, et autres
Publié: (2026) -
Iterative Deepening Sampling as Efficient Test-Time Scaling
par: Chen, Weizhe, et autres
Publié: (2025)