Position-Aware Depth Decay Decoding ($D^3$): Boosting Large Language Model Inference Efficiency
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fan, Siqi, Fang, Xuezhi, Xing, Xingrun, Han, Peng, Shang, Shuo, Wang, Yequan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models
von: Fan, Siqi, et al.
Veröffentlicht: (2025)
von: Fan, Siqi, et al.
Veröffentlicht: (2025)
If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
von: Fan, Siqi, et al.
Veröffentlicht: (2025)
von: Fan, Siqi, et al.
Veröffentlicht: (2025)
Not All Layers of LLMs Are Necessary During Inference
von: Fan, Siqi, et al.
Veröffentlicht: (2024)
von: Fan, Siqi, et al.
Veröffentlicht: (2024)
SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking Mechanisms
von: Xing, Xingrun, et al.
Veröffentlicht: (2024)
von: Xing, Xingrun, et al.
Veröffentlicht: (2024)
Open-domain Implicit Format Control for Large Language Model Generation
von: Yao, Yiqun, et al.
Veröffentlicht: (2024)
von: Yao, Yiqun, et al.
Veröffentlicht: (2024)
PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
von: Ju, Yiming, et al.
Veröffentlicht: (2023)
von: Ju, Yiming, et al.
Veröffentlicht: (2023)
nanoLM: an Affordable LLM Pre-training Benchmark via Accurate Loss Prediction across Scales
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
von: Xia, Heming, et al.
Veröffentlicht: (2024)
von: Xia, Heming, et al.
Veröffentlicht: (2024)
DND: Boosting Large Language Models with Dynamic Nested Depth
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
FLM-101B: An Open LLM and How to Train It with $100K Budget
von: Li, Xiang, et al.
Veröffentlicht: (2023)
von: Li, Xiang, et al.
Veröffentlicht: (2023)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
Fast-Decoding Diffusion Language Models via Progress-Aware Confidence Schedules
von: Mohamed, Amr, et al.
Veröffentlicht: (2025)
von: Mohamed, Amr, et al.
Veröffentlicht: (2025)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
von: Hsu, Tzu-wen, et al.
Veröffentlicht: (2025)
von: Hsu, Tzu-wen, et al.
Veröffentlicht: (2025)
FlashDecoding++: Faster Large Language Model Inference on GPUs
von: Hong, Ke, et al.
Veröffentlicht: (2023)
von: Hong, Ke, et al.
Veröffentlicht: (2023)
Plato: Plan to Efficiently Decode for Large Language Model Inference
von: Jin, Shuowei, et al.
Veröffentlicht: (2024)
von: Jin, Shuowei, et al.
Veröffentlicht: (2024)
Position Engineering: Boosting Large Language Models through Positional Information Manipulation
von: He, Zhiyuan, et al.
Veröffentlicht: (2024)
von: He, Zhiyuan, et al.
Veröffentlicht: (2024)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
von: Liu, Dong, et al.
Veröffentlicht: (2025)
von: Liu, Dong, et al.
Veröffentlicht: (2025)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
von: Huang, Kaiyu, et al.
Veröffentlicht: (2025)
von: Huang, Kaiyu, et al.
Veröffentlicht: (2025)
Training and Inference Efficiency of Encoder-Decoder Speech Models
von: Żelasko, Piotr, et al.
Veröffentlicht: (2025)
von: Żelasko, Piotr, et al.
Veröffentlicht: (2025)
Decoding Knowledge in Large Language Models: A Framework for Categorization and Comprehension
von: Fang, Yanbo, et al.
Veröffentlicht: (2025)
von: Fang, Yanbo, et al.
Veröffentlicht: (2025)
Evolution without Large Models: Training Language Model with Task Principles
von: Zhu, Minghang, et al.
Veröffentlicht: (2025)
von: Zhu, Minghang, et al.
Veröffentlicht: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
A Novel Paradigm Boosting Translation Capabilities of Large Language Models
von: Guo, Jiaxin, et al.
Veröffentlicht: (2024)
von: Guo, Jiaxin, et al.
Veröffentlicht: (2024)
PretrainZero: Reinforcement Active Pretraining
von: Xing, Xingrun, et al.
Veröffentlicht: (2025)
von: Xing, Xingrun, et al.
Veröffentlicht: (2025)
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
von: Fernandez, Jared, et al.
Veröffentlicht: (2025)
von: Fernandez, Jared, et al.
Veröffentlicht: (2025)
Semantic-guided Diverse Decoding for Large Language Model
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit Access
von: Geng, Saibo, et al.
Veröffentlicht: (2024)
von: Geng, Saibo, et al.
Veröffentlicht: (2024)
Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
von: Bao, Wenrui, et al.
Veröffentlicht: (2025)
von: Bao, Wenrui, et al.
Veröffentlicht: (2025)
A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency
von: Park, Sihyeong, et al.
Veröffentlicht: (2025)
von: Park, Sihyeong, et al.
Veröffentlicht: (2025)
Towards Coarse-to-Fine Evaluation of Inference Efficiency for Large Language Models
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models
von: Welleck, Sean, et al.
Veröffentlicht: (2024)
von: Welleck, Sean, et al.
Veröffentlicht: (2024)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2025)
Boosting Large Language Models for Mental Manipulation Detection via Data Augmentation and Distillation
von: Gao, Yuansheng, et al.
Veröffentlicht: (2025)
von: Gao, Yuansheng, et al.
Veröffentlicht: (2025)
Premise Order Matters in Reasoning with Large Language Models
von: Chen, Xinyun, et al.
Veröffentlicht: (2024)
von: Chen, Xinyun, et al.
Veröffentlicht: (2024)
SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking
von: Xing, Xingrun, et al.
Veröffentlicht: (2024)
von: Xing, Xingrun, et al.
Veröffentlicht: (2024)
D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models
von: Wan, Zhongwei, et al.
Veröffentlicht: (2024)
von: Wan, Zhongwei, et al.
Veröffentlicht: (2024)
Sketch: A Toolkit for Streamlining LLM Operations
von: Jiang, Xin, et al.
Veröffentlicht: (2024)
von: Jiang, Xin, et al.
Veröffentlicht: (2024)
TimeBill: Time-Budgeted Inference for Large Language Models
von: Fan, Qi, et al.
Veröffentlicht: (2025)
von: Fan, Qi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models
von: Fan, Siqi, et al.
Veröffentlicht: (2025) -
If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
von: Fan, Siqi, et al.
Veröffentlicht: (2025) -
Not All Layers of LLMs Are Necessary During Inference
von: Fan, Siqi, et al.
Veröffentlicht: (2024) -
SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking Mechanisms
von: Xing, Xingrun, et al.
Veröffentlicht: (2024) -
Open-domain Implicit Format Control for Large Language Model Generation
von: Yao, Yiqun, et al.
Veröffentlicht: (2024)