RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic Draft Trees
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Junjie, Li, Jinlong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
di: Gao, Xuanqi, et al.
Pubblicazione: (2025)
di: Gao, Xuanqi, et al.
Pubblicazione: (2025)
Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation
di: Chen, Jiaju, et al.
Pubblicazione: (2026)
di: Chen, Jiaju, et al.
Pubblicazione: (2026)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
di: Li, Yuanhao, et al.
Pubblicazione: (2025)
di: Li, Yuanhao, et al.
Pubblicazione: (2025)
Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree
di: Gao, Xiangxiang, et al.
Pubblicazione: (2024)
di: Gao, Xiangxiang, et al.
Pubblicazione: (2024)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
di: He, Zifan, et al.
Pubblicazione: (2026)
di: He, Zifan, et al.
Pubblicazione: (2026)
Adaptive Draft-Verification for Efficient Large Language Model Decoding
di: Liu, Xukun, et al.
Pubblicazione: (2024)
di: Liu, Xukun, et al.
Pubblicazione: (2024)
Progressive Refinement Regulation for Accelerating Diffusion Language Model Decoding
di: Wan, Lipeng, et al.
Pubblicazione: (2026)
di: Wan, Lipeng, et al.
Pubblicazione: (2026)
Draft-based Approximate Inference for LLMs
di: Galim, Kevin, et al.
Pubblicazione: (2025)
di: Galim, Kevin, et al.
Pubblicazione: (2025)
DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution
di: Hu, Yunhai, et al.
Pubblicazione: (2026)
di: Hu, Yunhai, et al.
Pubblicazione: (2026)
Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models
di: Xiong, Zidi, et al.
Pubblicazione: (2025)
di: Xiong, Zidi, et al.
Pubblicazione: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
Self-Selected Attention Span for Accelerating Large Language Model Inference
di: Jin, Tian, et al.
Pubblicazione: (2024)
di: Jin, Tian, et al.
Pubblicazione: (2024)
Legal Documents Drafting with Fine-Tuned Pre-Trained Large Language Model
di: Lin, Chun-Hsien, et al.
Pubblicazione: (2024)
di: Lin, Chun-Hsien, et al.
Pubblicazione: (2024)
Causal Inference with Large Language Model: A Survey
di: Ma, Jing
Pubblicazione: (2024)
di: Ma, Jing
Pubblicazione: (2024)
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
di: Chen, Hongzheng, et al.
Pubblicazione: (2023)
di: Chen, Hongzheng, et al.
Pubblicazione: (2023)
Comet: Accelerating Private Inference for Large Language Model by Predicting Activation Sparsity
di: Yan, Guang, et al.
Pubblicazione: (2025)
di: Yan, Guang, et al.
Pubblicazione: (2025)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
di: Chen, Sihan, et al.
Pubblicazione: (2025)
di: Chen, Sihan, et al.
Pubblicazione: (2025)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
di: Huang, Jerry, et al.
Pubblicazione: (2024)
di: Huang, Jerry, et al.
Pubblicazione: (2024)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
di: Wu, Shutong, et al.
Pubblicazione: (2025)
di: Wu, Shutong, et al.
Pubblicazione: (2025)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
RADAR: Learning to Route with Asymmetry-aware DistAnce Representations
di: Yi, Hang, et al.
Pubblicazione: (2026)
di: Yi, Hang, et al.
Pubblicazione: (2026)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
di: Chen, Yitian, et al.
Pubblicazione: (2025)
di: Chen, Yitian, et al.
Pubblicazione: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
di: Sun, Ryan, et al.
Pubblicazione: (2024)
di: Sun, Ryan, et al.
Pubblicazione: (2024)
Unveiling the Reasoning Process of Large Language Models
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
Inference Performance Optimization for Large Language Models on CPUs
di: He, Pujiang, et al.
Pubblicazione: (2024)
di: He, Pujiang, et al.
Pubblicazione: (2024)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
di: Zhao, Yao, et al.
Pubblicazione: (2023)
di: Zhao, Yao, et al.
Pubblicazione: (2023)
Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
di: Liu, Yihao, et al.
Pubblicazione: (2025)
di: Liu, Yihao, et al.
Pubblicazione: (2025)
Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL
di: He, Haoyang, et al.
Pubblicazione: (2025)
di: He, Haoyang, et al.
Pubblicazione: (2025)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
di: Wu, Tianyu, et al.
Pubblicazione: (2026)
di: Wu, Tianyu, et al.
Pubblicazione: (2026)
TIDE: Temporal Incremental Draft Engine for Self-Improving LLM Inference
di: Park, Jiyoung, et al.
Pubblicazione: (2026)
di: Park, Jiyoung, et al.
Pubblicazione: (2026)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning
di: Tian, Chang, et al.
Pubblicazione: (2025)
di: Tian, Chang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
di: Gao, Xuanqi, et al.
Pubblicazione: (2025) -
Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation
di: Chen, Jiaju, et al.
Pubblicazione: (2026) -
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024) -
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
di: Li, Yuanhao, et al.
Pubblicazione: (2025) -
Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree
di: Gao, Xiangxiang, et al.
Pubblicazione: (2024)