WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Sihan, Zhao, Dan, Ko, Jongwoo, Banbury, Colby, Zhuang, Huiping, Liang, Luming, Cameron, Pashmina, Chen, Tianyi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
by: Chen, Tianyi, et al.
Published: (2026)
by: Chen, Tianyi, et al.
Published: (2026)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
by: Ko, Jongwoo, et al.
Published: (2026)
by: Ko, Jongwoo, et al.
Published: (2026)
HESSO: Towards Automatic Efficient and User Friendly Any Neural Network Training and Pruning
by: Chen, Tianyi, et al.
Published: (2024)
by: Chen, Tianyi, et al.
Published: (2024)
WinClick: GUI Grounding with Multimodal Large Language Models
by: Hui, Zheng, et al.
Published: (2025)
by: Hui, Zheng, et al.
Published: (2025)
Fast Data Aware Neural Architecture Search via Supernet Accelerated Evaluation
by: Njor, Emil, et al.
Published: (2025)
by: Njor, Emil, et al.
Published: (2025)
DistiLLM: Towards Streamlined Distillation for Large Language Models
by: Ko, Jongwoo, et al.
Published: (2024)
by: Ko, Jongwoo, et al.
Published: (2024)
AppSelectBench: Application-Level Tool Selection Benchmark
by: Chen, Tianyi, et al.
Published: (2025)
by: Chen, Tianyi, et al.
Published: (2025)
DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs
by: Ko, Jongwoo, et al.
Published: (2025)
by: Ko, Jongwoo, et al.
Published: (2025)
Comet: Accelerating Private Inference for Large Language Model by Predicting Activation Sparsity
by: Yan, Guang, et al.
Published: (2025)
by: Yan, Guang, et al.
Published: (2025)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
by: Zhao, Yao, et al.
Published: (2023)
by: Zhao, Yao, et al.
Published: (2023)
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
by: Zeng, Ziqian, et al.
Published: (2023)
by: Zeng, Ziqian, et al.
Published: (2023)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
by: Zeng, Ziqian, et al.
Published: (2024)
by: Zeng, Ziqian, et al.
Published: (2024)
FORA: Fast-Forward Caching in Diffusion Transformer Acceleration
by: Selvaraju, Pratheba, et al.
Published: (2024)
by: Selvaraju, Pratheba, et al.
Published: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
by: Kim, Mingyu, et al.
Published: (2025)
by: Kim, Mingyu, et al.
Published: (2025)
Supercharging Bayesian Inference with Reliable AI-Informed Priors
by: Choi, Jongwoo, et al.
Published: (2026)
by: Choi, Jongwoo, et al.
Published: (2026)
PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
by: Zeng, Ziqian, et al.
Published: (2024)
by: Zeng, Ziqian, et al.
Published: (2024)
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
by: Qu, Xiaoyi, et al.
Published: (2025)
by: Qu, Xiaoyi, et al.
Published: (2025)
Towards Difficulty-Agnostic Efficient Transfer Learning for Vision-Language Models
by: Yang, Yongjin, et al.
Published: (2023)
by: Yang, Yongjin, et al.
Published: (2023)
Massive Activations in Large Language Models
by: Sun, Mingjie, et al.
Published: (2024)
by: Sun, Mingjie, et al.
Published: (2024)
CoreInfer: Accelerating Large Language Model Inference with Semantics-Inspired Adaptive Sparse Activation
by: Wang, Qinsi, et al.
Published: (2024)
by: Wang, Qinsi, et al.
Published: (2024)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
by: Lu, Weikai, et al.
Published: (2025)
by: Lu, Weikai, et al.
Published: (2025)
CUA-Skill: Develop Skills for Computer Using Agent
by: Chen, Tianyi, et al.
Published: (2026)
by: Chen, Tianyi, et al.
Published: (2026)
Explicit Inductive Inference using Large Language Models
by: Liu, Tianyang, et al.
Published: (2024)
by: Liu, Tianyang, et al.
Published: (2024)
Neuron-based Personality Trait Induction in Large Language Models
by: Deng, Jia, et al.
Published: (2024)
by: Deng, Jia, et al.
Published: (2024)
The Efficiency Spectrum of Large Language Models: An Algorithmic Survey
by: Ding, Tianyu, et al.
Published: (2023)
by: Ding, Tianyu, et al.
Published: (2023)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
by: Lu, Weikai, et al.
Published: (2024)
by: Lu, Weikai, et al.
Published: (2024)
SeRA: Self-Reviewing and Alignment of Large Language Models using Implicit Reward Margins
by: Ko, Jongwoo, et al.
Published: (2024)
by: Ko, Jongwoo, et al.
Published: (2024)
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models
by: Tang, Tianyi, et al.
Published: (2024)
by: Tang, Tianyi, et al.
Published: (2024)
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
by: Ashkboos, Saleh, et al.
Published: (2024)
by: Ashkboos, Saleh, et al.
Published: (2024)
Model-Informed Flows for Bayesian Inference
by: Ko, Joohwan, et al.
Published: (2025)
by: Ko, Joohwan, et al.
Published: (2025)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
by: Wang, Zhaoxin, et al.
Published: (2026)
by: Wang, Zhaoxin, et al.
Published: (2026)
Remediation and Reinforcement: Books for Children with Visual Perceptual Impairments.
by: Banbury, Mary M.
Published: (1980)
by: Banbury, Mary M.
Published: (1980)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
by: Chen, Fahao, et al.
Published: (2025)
by: Chen, Fahao, et al.
Published: (2025)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
by: Zhang, Tao, et al.
Published: (2024)
by: Zhang, Tao, et al.
Published: (2024)
Mechanistic Circuit-Based Knowledge Editing in Large Language Models
by: Zhao, Tianyi, et al.
Published: (2026)
by: Zhao, Tianyi, et al.
Published: (2026)
T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models
by: Chen, Yiteng, et al.
Published: (2025)
by: Chen, Yiteng, et al.
Published: (2025)
FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models
by: Wang, Shiyi, et al.
Published: (2025)
by: Wang, Shiyi, et al.
Published: (2025)
Activation-Informed Merging of Large Language Models
by: Nobari, Amin Heyrani, et al.
Published: (2025)
by: Nobari, Amin Heyrani, et al.
Published: (2025)
GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference
by: Zeng, Chao, et al.
Published: (2024)
by: Zeng, Chao, et al.
Published: (2024)
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
by: Ha, Jiwoo, et al.
Published: (2026)
by: Ha, Jiwoo, et al.
Published: (2026)
Similar Items
-
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
by: Chen, Tianyi, et al.
Published: (2026) -
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
by: Ko, Jongwoo, et al.
Published: (2026) -
HESSO: Towards Automatic Efficient and User Friendly Any Neural Network Training and Pruning
by: Chen, Tianyi, et al.
Published: (2024) -
WinClick: GUI Grounding with Multimodal Large Language Models
by: Hui, Zheng, et al.
Published: (2025) -
Fast Data Aware Neural Architecture Search via Supernet Accelerated Evaluation
by: Njor, Emil, et al.
Published: (2025)