Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Taniguchi, Rei, Dong, Yuyang, Onizuka, Makoto, Xiao, Chuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
von: Qin, Jiayu, et al.
Veröffentlicht: (2025)
von: Qin, Jiayu, et al.
Veröffentlicht: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
von: Li, Xing, et al.
Veröffentlicht: (2025)
von: Li, Xing, et al.
Veröffentlicht: (2025)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
von: Fu, Qichen, et al.
Veröffentlicht: (2024)
von: Fu, Qichen, et al.
Veröffentlicht: (2024)
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
von: Wang, Jiawei, et al.
Veröffentlicht: (2024)
von: Wang, Jiawei, et al.
Veröffentlicht: (2024)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
von: He, Junhui, et al.
Veröffentlicht: (2024)
von: He, Junhui, et al.
Veröffentlicht: (2024)
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
von: Ichikawa, Yuma, et al.
Veröffentlicht: (2025)
von: Ichikawa, Yuma, et al.
Veröffentlicht: (2025)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
von: Sung, Yi-Lin, et al.
Veröffentlicht: (2023)
von: Sung, Yi-Lin, et al.
Veröffentlicht: (2023)
Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning
von: Kim, Minkyu, et al.
Veröffentlicht: (2026)
von: Kim, Minkyu, et al.
Veröffentlicht: (2026)
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
von: Dong, Harry, et al.
Veröffentlicht: (2024)
von: Dong, Harry, et al.
Veröffentlicht: (2024)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
von: Sim, Woo Seob, et al.
Veröffentlicht: (2026)
von: Sim, Woo Seob, et al.
Veröffentlicht: (2026)
Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers
von: Ye, Donald
Veröffentlicht: (2026)
von: Ye, Donald
Veröffentlicht: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
von: Lu, Liming, et al.
Veröffentlicht: (2026)
von: Lu, Liming, et al.
Veröffentlicht: (2026)
TIDE: Every Layer Knows the Token Beneath the Context
von: Jaiswal, Ajay, et al.
Veröffentlicht: (2026)
von: Jaiswal, Ajay, et al.
Veröffentlicht: (2026)
Not All Layers of LLMs Are Necessary During Inference
von: Fan, Siqi, et al.
Veröffentlicht: (2024)
von: Fan, Siqi, et al.
Veröffentlicht: (2024)
Jellyfish: A Large Language Model for Data Preprocessing
von: Zhang, Haochen, et al.
Veröffentlicht: (2023)
von: Zhang, Haochen, et al.
Veröffentlicht: (2023)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
von: Pei, Zehua, et al.
Veröffentlicht: (2024)
von: Pei, Zehua, et al.
Veröffentlicht: (2024)
Unraveling Token Prediction Refinement and Identifying Essential Layers in Language Models
von: Kongmanee, Jaturong
Veröffentlicht: (2025)
von: Kongmanee, Jaturong
Veröffentlicht: (2025)
Tracing Representation Progression: Analyzing and Enhancing Layer-Wise Similarity
von: Jiang, Jiachen, et al.
Veröffentlicht: (2024)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2024)
Dr.LLM: Dynamic Layer Routing in LLMs
von: Heakl, Ahmed, et al.
Veröffentlicht: (2025)
von: Heakl, Ahmed, et al.
Veröffentlicht: (2025)
LESA: Learnable LLM Layer Scaling-Up
von: Yang, Yifei, et al.
Veröffentlicht: (2025)
von: Yang, Yifei, et al.
Veröffentlicht: (2025)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
von: Wu, Wei, et al.
Veröffentlicht: (2024)
von: Wu, Wei, et al.
Veröffentlicht: (2024)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
von: Achtibat, Reduan, et al.
Veröffentlicht: (2024)
von: Achtibat, Reduan, et al.
Veröffentlicht: (2024)
OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference
von: Shin, Seungjun, et al.
Veröffentlicht: (2025)
von: Shin, Seungjun, et al.
Veröffentlicht: (2025)
Model Assembly Learning with Heterogeneous Layer Weight Merging
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2025)
ADMN: A Layer-Wise Adaptive Multimodal Network for Dynamic Input Noise and Compute Resources
von: Wu, Jason, et al.
Veröffentlicht: (2025)
von: Wu, Jason, et al.
Veröffentlicht: (2025)
StateAct: Enhancing LLM Base Agents via Self-prompting and State-tracking
von: Rozanov, Nikolai, et al.
Veröffentlicht: (2024)
von: Rozanov, Nikolai, et al.
Veröffentlicht: (2024)
LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference
von: Kapadia, Shashank, et al.
Veröffentlicht: (2026)
von: Kapadia, Shashank, et al.
Veröffentlicht: (2026)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
von: Elhoushi, Mostafa, et al.
Veröffentlicht: (2024)
von: Elhoushi, Mostafa, et al.
Veröffentlicht: (2024)
TrimLLM: Progressive Layer Dropping for Domain-Specific LLMs
von: Hu, Lanxiang, et al.
Veröffentlicht: (2024)
von: Hu, Lanxiang, et al.
Veröffentlicht: (2024)
Concept Layers: Enhancing Interpretability and Intervenability via LLM Conceptualization
von: Bidusa, Or Raphael, et al.
Veröffentlicht: (2025)
von: Bidusa, Or Raphael, et al.
Veröffentlicht: (2025)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
Layer by Layer: Uncovering Hidden Representations in Language Models
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
von: Rai, Arushi, et al.
Veröffentlicht: (2026)
von: Rai, Arushi, et al.
Veröffentlicht: (2026)
Think Clearly: Improving Reasoning via Redundant Token Pruning
von: Choi, Daewon, et al.
Veröffentlicht: (2025)
von: Choi, Daewon, et al.
Veröffentlicht: (2025)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
von: Hu, Zhimin, et al.
Veröffentlicht: (2026)
von: Hu, Zhimin, et al.
Veröffentlicht: (2026)
Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction
von: Shi, Zhenmei, et al.
Veröffentlicht: (2024)
von: Shi, Zhenmei, et al.
Veröffentlicht: (2024)
Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models
von: Mersha, Melkamu Abay, et al.
Veröffentlicht: (2026)
von: Mersha, Melkamu Abay, et al.
Veröffentlicht: (2026)
Adaptive Computation Pruning for the Forgetting Transformer
von: Lin, Zhixuan, et al.
Veröffentlicht: (2025)
von: Lin, Zhixuan, et al.
Veröffentlicht: (2025)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
von: Wen, Zhuofan, et al.
Veröffentlicht: (2026)
von: Wen, Zhuofan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
von: Yang, Yifei, et al.
Veröffentlicht: (2024) -
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
von: Qin, Jiayu, et al.
Veröffentlicht: (2025) -
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
von: Li, Xing, et al.
Veröffentlicht: (2025) -
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
von: Fu, Qichen, et al.
Veröffentlicht: (2024) -
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
von: Wang, Jiawei, et al.
Veröffentlicht: (2024)