Accelerating Large Language Model Inference via Early-Exiting Algorithms
Fuente:
arXiv
Salvato in:
| Autore principale: | Bae, Sangmin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
di: Zeng, Ziqian, et al.
Pubblicazione: (2023)
di: Zeng, Ziqian, et al.
Pubblicazione: (2023)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting
di: Hamed, Omar, et al.
Pubblicazione: (2024)
di: Hamed, Omar, et al.
Pubblicazione: (2024)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Inference with Self-Supervised Early Exits
di: Valade, Florian
Pubblicazione: (2024)
di: Valade, Florian
Pubblicazione: (2024)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
di: Xie, Zuan, et al.
Pubblicazione: (2024)
di: Xie, Zuan, et al.
Pubblicazione: (2024)
Inference Acceleration for Large Language Models on CPUs
di: PS, Ditto, et al.
Pubblicazione: (2024)
di: PS, Ditto, et al.
Pubblicazione: (2024)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
DE$^3$-BERT: Distance-Enhanced Early Exiting for BERT based on Prototypical Networks
di: He, Jianing, et al.
Pubblicazione: (2024)
di: He, Jianing, et al.
Pubblicazione: (2024)
EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
di: Li, Yuhui, et al.
Pubblicazione: (2025)
di: Li, Yuhui, et al.
Pubblicazione: (2025)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
di: Liu, Yijin, et al.
Pubblicazione: (2024)
di: Liu, Yijin, et al.
Pubblicazione: (2024)
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
di: Yoon, Ji Won, et al.
Pubblicazione: (2022)
di: Yoon, Ji Won, et al.
Pubblicazione: (2022)
Self-Selected Attention Span for Accelerating Large Language Model Inference
di: Jin, Tian, et al.
Pubblicazione: (2024)
di: Jin, Tian, et al.
Pubblicazione: (2024)
Carpe Diem: On the Evaluation of World Knowledge in Lifelong Language Models
di: Kim, Yujin, et al.
Pubblicazione: (2023)
di: Kim, Yujin, et al.
Pubblicazione: (2023)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
di: Shao, Wei, et al.
Pubblicazione: (2025)
di: Shao, Wei, et al.
Pubblicazione: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
Hybrid Architectures for Language Models: Systematic Analysis and Design Insights
di: Bae, Sangmin, et al.
Pubblicazione: (2025)
di: Bae, Sangmin, et al.
Pubblicazione: (2025)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models
di: Welleck, Sean, et al.
Pubblicazione: (2024)
di: Welleck, Sean, et al.
Pubblicazione: (2024)
A Simple Early Exiting Framework for Accelerated Sampling in Diffusion Models
di: Moon, Taehong, et al.
Pubblicazione: (2024)
di: Moon, Taehong, et al.
Pubblicazione: (2024)
Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language Models
di: Madaan, Lovish, et al.
Pubblicazione: (2024)
di: Madaan, Lovish, et al.
Pubblicazione: (2024)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
di: Hu, Zhanqiu, et al.
Pubblicazione: (2025)
di: Hu, Zhanqiu, et al.
Pubblicazione: (2025)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
di: Yang, Jingbo, et al.
Pubblicazione: (2025)
di: Yang, Jingbo, et al.
Pubblicazione: (2025)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
di: Wu, Pengfei, et al.
Pubblicazione: (2024)
di: Wu, Pengfei, et al.
Pubblicazione: (2024)
Enhancing and Accelerating Large Language Models via Instruction-Aware Contextual Compression
di: Hou, Haowen, et al.
Pubblicazione: (2024)
di: Hou, Haowen, et al.
Pubblicazione: (2024)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
Sparsity-Accelerated Training for Large Language Models
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Reasoning via Speculative Search
di: Wang, Zhihai, et al.
Pubblicazione: (2025)
di: Wang, Zhihai, et al.
Pubblicazione: (2025)
CoreInfer: Accelerating Large Language Model Inference with Semantics-Inspired Adaptive Sparse Activation
di: Wang, Qinsi, et al.
Pubblicazione: (2024)
di: Wang, Qinsi, et al.
Pubblicazione: (2024)
Large Language Models are Algorithmically Blind
di: Venkatesh, Sohan, et al.
Pubblicazione: (2026)
di: Venkatesh, Sohan, et al.
Pubblicazione: (2026)
Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models
di: Song, Sangmin, et al.
Pubblicazione: (2025)
di: Song, Sangmin, et al.
Pubblicazione: (2025)
Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
di: Bao, Wenrui, et al.
Pubblicazione: (2025)
di: Bao, Wenrui, et al.
Pubblicazione: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
di: Zhang, Jun, et al.
Pubblicazione: (2023)
di: Zhang, Jun, et al.
Pubblicazione: (2023)
Diffusion Language Model Inference with Monte Carlo Tree Search
di: Huang, Zheng, et al.
Pubblicazione: (2025)
di: Huang, Zheng, et al.
Pubblicazione: (2025)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
Accelerating Clinical Evidence Synthesis with Large Language Models
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
di: Zeng, Ziqian, et al.
Pubblicazione: (2023) -
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025) -
Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting
di: Hamed, Omar, et al.
Pubblicazione: (2024) -
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
di: Liu, Fangcheng, et al.
Pubblicazione: (2024) -
Accelerating Large Language Model Inference with Self-Supervised Early Exits
di: Valade, Florian
Pubblicazione: (2024)