CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Junhui, Wu, Shangyu, Wen, Weidong, Xue, Chun Jason, Li, Qingan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
von: Taniguchi, Rei, et al.
Veröffentlicht: (2026)
von: Taniguchi, Rei, et al.
Veröffentlicht: (2026)
GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
von: Sattarifard, Amirmohsen, et al.
Veröffentlicht: (2025)
von: Sattarifard, Amirmohsen, et al.
Veröffentlicht: (2025)
EvoP: Robust LLM Inference via Evolutionary Pruning
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
von: Li, Xing, et al.
Veröffentlicht: (2025)
von: Li, Xing, et al.
Veröffentlicht: (2025)
SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
von: Czakó, Patrik, et al.
Veröffentlicht: (2025)
von: Czakó, Patrik, et al.
Veröffentlicht: (2025)
ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and Quantization
von: Yadav, Prateek, et al.
Veröffentlicht: (2023)
von: Yadav, Prateek, et al.
Veröffentlicht: (2023)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
von: Zhou, Yefan, et al.
Veröffentlicht: (2026)
von: Zhou, Yefan, et al.
Veröffentlicht: (2026)
POP: Prefill-Only Pruning for Efficient Large Model Inference
von: He, Junhui, et al.
Veröffentlicht: (2026)
von: He, Junhui, et al.
Veröffentlicht: (2026)
Language Model Prompt Selection via Simulation Optimization
von: Zhang, Haoting, et al.
Veröffentlicht: (2024)
von: Zhang, Haoting, et al.
Veröffentlicht: (2024)
Tree Matching Networks for Natural Language Inference: Parameter-Efficient Semantic Understanding via Dependency Parse Trees
von: Lunder, Jason
Veröffentlicht: (2025)
von: Lunder, Jason
Veröffentlicht: (2025)
Less is More: Improving LLM Alignment via Preference Data Selection
von: Deng, Xun, et al.
Veröffentlicht: (2025)
von: Deng, Xun, et al.
Veröffentlicht: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
von: Dzikanyanga, Gradwell, et al.
Veröffentlicht: (2026)
von: Dzikanyanga, Gradwell, et al.
Veröffentlicht: (2026)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
von: Wen, Zhuofan, et al.
Veröffentlicht: (2024)
von: Wen, Zhuofan, et al.
Veröffentlicht: (2024)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
von: Wu, Wei, et al.
Veröffentlicht: (2024)
von: Wu, Wei, et al.
Veröffentlicht: (2024)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
von: Bohne, Jason, et al.
Veröffentlicht: (2025)
von: Bohne, Jason, et al.
Veröffentlicht: (2025)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
von: Sim, Woo Seob, et al.
Veröffentlicht: (2026)
von: Sim, Woo Seob, et al.
Veröffentlicht: (2026)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
von: Guo, Song, et al.
Veröffentlicht: (2024)
von: Guo, Song, et al.
Veröffentlicht: (2024)
CHESS: Contextual Harnessing for Efficient SQL Synthesis
von: Talaei, Shayan, et al.
Veröffentlicht: (2024)
von: Talaei, Shayan, et al.
Veröffentlicht: (2024)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
von: Zhong, Tianle, et al.
Veröffentlicht: (2026)
von: Zhong, Tianle, et al.
Veröffentlicht: (2026)
On the Compressibility of Quantized Large Language Models
von: Mao, Yu, et al.
Veröffentlicht: (2024)
von: Mao, Yu, et al.
Veröffentlicht: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
von: Qiao, Aurick, et al.
Veröffentlicht: (2024)
von: Qiao, Aurick, et al.
Veröffentlicht: (2024)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
von: Chen, Zhipeng, et al.
Veröffentlicht: (2026)
von: Chen, Zhipeng, et al.
Veröffentlicht: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
von: Lu, Liming, et al.
Veröffentlicht: (2026)
von: Lu, Liming, et al.
Veröffentlicht: (2026)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
von: Zhu, Yuxuan, et al.
Veröffentlicht: (2025)
von: Zhu, Yuxuan, et al.
Veröffentlicht: (2025)
Shapley-Value-Based Graph Sparsification for GNN Inference
von: Akkas, Selahattin, et al.
Veröffentlicht: (2025)
von: Akkas, Selahattin, et al.
Veröffentlicht: (2025)
Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
von: Huang, Audrey, et al.
Veröffentlicht: (2024)
von: Huang, Audrey, et al.
Veröffentlicht: (2024)
One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Fibration Policy Optimization
von: Li, Chang, et al.
Veröffentlicht: (2026)
von: Li, Chang, et al.
Veröffentlicht: (2026)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
von: Wang, Fangxin, et al.
Veröffentlicht: (2026)
von: Wang, Fangxin, et al.
Veröffentlicht: (2026)
Membership Inference Attacks on LLM-based Recommender Systems
von: He, Jiajie, et al.
Veröffentlicht: (2025)
von: He, Jiajie, et al.
Veröffentlicht: (2025)
LLM-Select: Feature Selection with Large Language Models
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
ChameleonLLM: Batch-Aware Dynamic Low-Rank Adaptation via Inference-Time Clusters
von: Yuksel, Kamer Ali, et al.
Veröffentlicht: (2025)
von: Yuksel, Kamer Ali, et al.
Veröffentlicht: (2025)
Communication Compression for Tensor Parallel LLM Inference
von: Hansen-Palmus, Jan, et al.
Veröffentlicht: (2024)
von: Hansen-Palmus, Jan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
von: Taniguchi, Rei, et al.
Veröffentlicht: (2026) -
GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
von: Sattarifard, Amirmohsen, et al.
Veröffentlicht: (2025) -
EvoP: Robust LLM Inference via Evolutionary Pruning
von: Wu, Shangyu, et al.
Veröffentlicht: (2025) -
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
von: Yang, Yifei, et al.
Veröffentlicht: (2024) -
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
von: Li, Xing, et al.
Veröffentlicht: (2025)