HAMburger: Accelerating LLM Inference via Token Smashing
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jingyu, Zhang, Ce |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
di: Liu, Chengbo, et al.
Pubblicazione: (2024)
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
di: Long, Lingkun, et al.
Pubblicazione: (2025)
di: Long, Lingkun, et al.
Pubblicazione: (2025)
Accelerating Diffusion LLM Inference via Local Determinism Propagation
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
di: Liu, Xiang, et al.
Pubblicazione: (2025)
di: Liu, Xiang, et al.
Pubblicazione: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
di: Liu, Di, et al.
Pubblicazione: (2024)
di: Liu, Di, et al.
Pubblicazione: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
di: Long, Lingkun, et al.
Pubblicazione: (2026)
di: Long, Lingkun, et al.
Pubblicazione: (2026)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
di: Xia, Heming, et al.
Pubblicazione: (2024)
di: Xia, Heming, et al.
Pubblicazione: (2024)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
LLM Inference Acceleration via Efficient Operation Fusion
di: Salmani, Mahsa, et al.
Pubblicazione: (2025)
di: Salmani, Mahsa, et al.
Pubblicazione: (2025)
Hierarchical Verification of Speculative Beams for Accelerating LLM Inference
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
Squeezed Attention: Accelerating Long Context Length LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2024)
di: Hooper, Coleman, et al.
Pubblicazione: (2024)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
di: Shao, Wei, et al.
Pubblicazione: (2025)
di: Shao, Wei, et al.
Pubblicazione: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
di: Lee, Younjoo, et al.
Pubblicazione: (2026)
di: Lee, Younjoo, et al.
Pubblicazione: (2026)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
di: Lin, Gang, et al.
Pubblicazione: (2026)
di: Lin, Gang, et al.
Pubblicazione: (2026)
In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
di: Li, Zeping, et al.
Pubblicazione: (2024)
di: Li, Zeping, et al.
Pubblicazione: (2024)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
di: Liu, Hanbing, et al.
Pubblicazione: (2025)
di: Liu, Hanbing, et al.
Pubblicazione: (2025)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
di: He, Linda, et al.
Pubblicazione: (2025)
di: He, Linda, et al.
Pubblicazione: (2025)
Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference
di: Wilhelm, Patrick, et al.
Pubblicazione: (2026)
di: Wilhelm, Patrick, et al.
Pubblicazione: (2026)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
di: Song, Dinghong, et al.
Pubblicazione: (2025)
di: Song, Dinghong, et al.
Pubblicazione: (2025)
Accelerating Inference of Retrieval-Augmented Generation via Sparse Context Selection
di: Zhu, Yun, et al.
Pubblicazione: (2024)
di: Zhu, Yun, et al.
Pubblicazione: (2024)
Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
di: Liu, Tianyu, et al.
Pubblicazione: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
di: Tran, Toan, et al.
Pubblicazione: (2025)
di: Tran, Toan, et al.
Pubblicazione: (2025)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
di: Fu, Qichen, et al.
Pubblicazione: (2024)
di: Fu, Qichen, et al.
Pubblicazione: (2024)
How Much Can RAG Help the Reasoning of LLM?
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
di: Behnam, Payman, et al.
Pubblicazione: (2025)
di: Behnam, Payman, et al.
Pubblicazione: (2025)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
Your AI Bosses Are Still Prejudiced: The Emergence of Stereotypes in LLM-Based Multi-Agent Systems
di: Guo, Jingyu, et al.
Pubblicazione: (2025)
di: Guo, Jingyu, et al.
Pubblicazione: (2025)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
di: Zeng, Ziqian, et al.
Pubblicazione: (2024)
EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
di: Li, Yuhui, et al.
Pubblicazione: (2025)
di: Li, Yuhui, et al.
Pubblicazione: (2025)
Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs
di: Dong, Jiancheng, et al.
Pubblicazione: (2025)
di: Dong, Jiancheng, et al.
Pubblicazione: (2025)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
di: Liu, Jingyu, et al.
Pubblicazione: (2025) -
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
di: Liu, Chengbo, et al.
Pubblicazione: (2024) -
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
di: Long, Lingkun, et al.
Pubblicazione: (2025) -
Accelerating Diffusion LLM Inference via Local Determinism Propagation
di: Kong, Fanheng, et al.
Pubblicazione: (2025) -
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
di: Huang, Jianuo, et al.
Pubblicazione: (2025)