HAMburger: Accelerating LLM Inference via Token Smashing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jingyu, Zhang, Ce |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025)
par: Liu, Jingyu, et autres
Publié: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
par: Liu, Chengbo, et autres
Publié: (2024)
par: Liu, Chengbo, et autres
Publié: (2024)
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
par: Long, Lingkun, et autres
Publié: (2025)
par: Long, Lingkun, et autres
Publié: (2025)
Accelerating Diffusion LLM Inference via Local Determinism Propagation
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
par: Huang, Jianuo, et autres
Publié: (2025)
par: Huang, Jianuo, et autres
Publié: (2025)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
par: Long, Lingkun, et autres
Publié: (2026)
par: Long, Lingkun, et autres
Publié: (2026)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
par: Guo, Jinyu, et autres
Publié: (2026)
par: Guo, Jinyu, et autres
Publié: (2026)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
par: Luo, Xianzhen, et autres
Publié: (2024)
par: Luo, Xianzhen, et autres
Publié: (2024)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
par: Xia, Heming, et autres
Publié: (2024)
par: Xia, Heming, et autres
Publié: (2024)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
par: Tuli, Shikhar, et autres
Publié: (2024)
par: Tuli, Shikhar, et autres
Publié: (2024)
LLM Inference Acceleration via Efficient Operation Fusion
par: Salmani, Mahsa, et autres
Publié: (2025)
par: Salmani, Mahsa, et autres
Publié: (2025)
Hierarchical Verification of Speculative Beams for Accelerating LLM Inference
par: Sen, Jaydip, et autres
Publié: (2025)
par: Sen, Jaydip, et autres
Publié: (2025)
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
par: Jaber, Jaber, et autres
Publié: (2026)
par: Jaber, Jaber, et autres
Publié: (2026)
Squeezed Attention: Accelerating Long Context Length LLM Inference
par: Hooper, Coleman, et autres
Publié: (2024)
par: Hooper, Coleman, et autres
Publié: (2024)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
par: Shao, Wei, et autres
Publié: (2025)
par: Shao, Wei, et autres
Publié: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
par: Lee, Younjoo, et autres
Publié: (2026)
par: Lee, Younjoo, et autres
Publié: (2026)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026)
par: Lin, Gang, et autres
Publié: (2026)
In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
par: Li, Zeping, et autres
Publié: (2024)
par: Li, Zeping, et autres
Publié: (2024)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
par: Liu, Hanbing, et autres
Publié: (2025)
par: Liu, Hanbing, et autres
Publié: (2025)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
par: He, Linda, et autres
Publié: (2025)
par: He, Linda, et autres
Publié: (2025)
Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference
par: Wilhelm, Patrick, et autres
Publié: (2026)
par: Wilhelm, Patrick, et autres
Publié: (2026)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
par: Song, Dinghong, et autres
Publié: (2025)
par: Song, Dinghong, et autres
Publié: (2025)
Accelerating Inference of Retrieval-Augmented Generation via Sparse Context Selection
par: Zhu, Yun, et autres
Publié: (2024)
par: Zhu, Yun, et autres
Publié: (2024)
Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference
par: Qin, Zongyue, et autres
Publié: (2024)
par: Qin, Zongyue, et autres
Publié: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
par: Tran, Toan, et autres
Publié: (2025)
par: Tran, Toan, et autres
Publié: (2025)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
par: Fu, Qichen, et autres
Publié: (2024)
par: Fu, Qichen, et autres
Publié: (2024)
How Much Can RAG Help the Reasoning of LLM?
par: Liu, Jingyu, et autres
Publié: (2024)
par: Liu, Jingyu, et autres
Publié: (2024)
FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees
par: Oliaro, Gabriele, et autres
Publié: (2024)
par: Oliaro, Gabriele, et autres
Publié: (2024)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
par: Hu, Jingyu, et autres
Publié: (2024)
par: Hu, Jingyu, et autres
Publié: (2024)
Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving
par: Liu, Xunzhuo, et autres
Publié: (2026)
par: Liu, Xunzhuo, et autres
Publié: (2026)
Your AI Bosses Are Still Prejudiced: The Emergence of Stereotypes in LLM-Based Multi-Agent Systems
par: Guo, Jingyu, et autres
Publié: (2025)
par: Guo, Jingyu, et autres
Publié: (2025)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
par: Zeng, Ziqian, et autres
Publié: (2024)
par: Zeng, Ziqian, et autres
Publié: (2024)
EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
par: Li, Yuhui, et autres
Publié: (2025)
par: Li, Yuhui, et autres
Publié: (2025)
Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs
par: Dong, Jiancheng, et autres
Publié: (2025)
par: Dong, Jiancheng, et autres
Publié: (2025)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
par: Ouyang, Haojie, et autres
Publié: (2025)
par: Ouyang, Haojie, et autres
Publié: (2025)
Documents similaires
-
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025) -
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
par: Liu, Chengbo, et autres
Publié: (2024) -
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
par: Long, Lingkun, et autres
Publié: (2025) -
Accelerating Diffusion LLM Inference via Local Determinism Propagation
par: Kong, Fanheng, et autres
Publié: (2025) -
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
par: Huang, Jianuo, et autres
Publié: (2025)