Homeostasis and Sparsity in Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Kotyuzanskiy, Leonid, Klimov, Artem |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting Transformers through the Lens of Low Entropy and Dynamic Sparsity
di: Ren, Ruifeng, et al.
Pubblicazione: (2025)
di: Ren, Ruifeng, et al.
Pubblicazione: (2025)
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
Uncovering Layer-Dependent Activation Sparsity Patterns in ReLU Transformers
di: Wild, Cody, et al.
Pubblicazione: (2024)
di: Wild, Cody, et al.
Pubblicazione: (2024)
EcoSpa: Efficient Transformer Training with Coupled Sparsity
di: Xiao, Jinqi, et al.
Pubblicazione: (2025)
di: Xiao, Jinqi, et al.
Pubblicazione: (2025)
Improving Decision Sparsity
di: Sun, Yiyang, et al.
Pubblicazione: (2024)
di: Sun, Yiyang, et al.
Pubblicazione: (2024)
Polar Sparsity: High Throughput Batched LLM Inferencing with Scalable Contextual Sparsity
di: Shrestha, Susav, et al.
Pubblicazione: (2025)
di: Shrestha, Susav, et al.
Pubblicazione: (2025)
Sparsity and Out-of-Distribution Generalization
di: Aaronson, Scott, et al.
Pubblicazione: (2026)
di: Aaronson, Scott, et al.
Pubblicazione: (2026)
Sparsity and Superposition in Mixture of Experts
di: Chaudhari, Marmik, et al.
Pubblicazione: (2025)
di: Chaudhari, Marmik, et al.
Pubblicazione: (2025)
Accelerating Transformer Inference and Training with 2:4 Activation Sparsity
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
On the Sparsity of the Strong Lottery Ticket Hypothesis
di: Natale, Emanuele, et al.
Pubblicazione: (2024)
di: Natale, Emanuele, et al.
Pubblicazione: (2024)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
di: Sawmya, Shashata, et al.
Pubblicazione: (2024)
di: Sawmya, Shashata, et al.
Pubblicazione: (2024)
On the Identifiability of Nonlinear ICA: Sparsity and Beyond
di: Zheng, Yujia, et al.
Pubblicazione: (2022)
di: Zheng, Yujia, et al.
Pubblicazione: (2022)
Sparsity-Aware Evolution for Model Merging
di: Zhang, Huan, et al.
Pubblicazione: (2026)
di: Zhang, Huan, et al.
Pubblicazione: (2026)
Scaling Attention via Feature Sparsity
di: Xie, Yan, et al.
Pubblicazione: (2026)
di: Xie, Yan, et al.
Pubblicazione: (2026)
Fuzzy-Pattern Tsetlin Machine
di: Hnilov, Artem
Pubblicazione: (2025)
di: Hnilov, Artem
Pubblicazione: (2025)
HashAttention: Semantic Sparsity for Faster Inference
di: Desai, Aditya, et al.
Pubblicazione: (2024)
di: Desai, Aditya, et al.
Pubblicazione: (2024)
Inference Time Context Sparsity: Illusion or Opportunity?
di: Joshi, Sahil, et al.
Pubblicazione: (2026)
di: Joshi, Sahil, et al.
Pubblicazione: (2026)
Robot Learning with Sparsity and Scarcity
di: Xu, Jingxi
Pubblicazione: (2025)
di: Xu, Jingxi
Pubblicazione: (2025)
Navigating Extremes: Dynamic Sparsity in Large Output Spaces
di: Ullah, Nasib, et al.
Pubblicazione: (2024)
di: Ullah, Nasib, et al.
Pubblicazione: (2024)
Post-Training Statistical Calibration for Higher Activation Sparsity
di: Chua, Vui Seng, et al.
Pubblicazione: (2024)
di: Chua, Vui Seng, et al.
Pubblicazione: (2024)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
di: Guo, Wentao, et al.
Pubblicazione: (2024)
di: Guo, Wentao, et al.
Pubblicazione: (2024)
Joint Training Across Multiple Activation Sparsity Regimes
di: Wang, Haotian
Pubblicazione: (2026)
di: Wang, Haotian
Pubblicazione: (2026)
Towards the Connection between Activation Sparsity and Flat Minima
di: Peng, Ze, et al.
Pubblicazione: (2026)
di: Peng, Ze, et al.
Pubblicazione: (2026)
Compositional Sparsity as an Inductive Bias for Neural Architecture Design
di: Lin, Hongyu, et al.
Pubblicazione: (2026)
di: Lin, Hongyu, et al.
Pubblicazione: (2026)
On the Interplay Between Sparsity and Training in Deep Reinforcement Learning
di: Davelouis, Fatima, et al.
Pubblicazione: (2025)
di: Davelouis, Fatima, et al.
Pubblicazione: (2025)
An Efficient Training Algorithm for Models with Block-wise Sparsity
di: Zhu, Ding, et al.
Pubblicazione: (2025)
di: Zhu, Ding, et al.
Pubblicazione: (2025)
Sparsity-Driven Plasticity in Multi-Task Reinforcement Learning
di: Todorov, Aleksandar, et al.
Pubblicazione: (2025)
di: Todorov, Aleksandar, et al.
Pubblicazione: (2025)
Dynamic Sparsity: Challenging Common Sparsity Assumptions for Learning World Models in Robotic Reinforcement Learning Benchmarks
di: Pandaram, Muthukumar, et al.
Pubblicazione: (2025)
di: Pandaram, Muthukumar, et al.
Pubblicazione: (2025)
SPICED: A Synaptic Homeostasis-Inspired Framework for Unsupervised Continual EEG Decoding
di: Zhou, Yangxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yangxuan, et al.
Pubblicazione: (2025)
LoRA Dropout as a Sparsity Regularizer for Overfitting Control
di: Lin, Yang, et al.
Pubblicazione: (2024)
di: Lin, Yang, et al.
Pubblicazione: (2024)
Activation Sparsity Opportunities for Compressing General Large Language Models
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
A Sparsity Principle for Partially Observable Causal Representation Learning
di: Xu, Danru, et al.
Pubblicazione: (2024)
di: Xu, Danru, et al.
Pubblicazione: (2024)
Effective Interplay between Sparsity and Quantization: From Theory to Practice
di: Harma, Simla Burcu, et al.
Pubblicazione: (2024)
di: Harma, Simla Burcu, et al.
Pubblicazione: (2024)
Toward Efficient Permutation for Hierarchical N:M Sparsity on GPUs
di: Yu, Seungmin, et al.
Pubblicazione: (2024)
di: Yu, Seungmin, et al.
Pubblicazione: (2024)
Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning
di: Cho, Minjae, et al.
Pubblicazione: (2024)
di: Cho, Minjae, et al.
Pubblicazione: (2024)
RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoning
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
Minimum Variance Unbiased N:M Sparsity for the Neural Gradients
di: Chmiel, Brian, et al.
Pubblicazione: (2022)
di: Chmiel, Brian, et al.
Pubblicazione: (2022)
Large Language Model Compression with Global Rank and Sparsity Optimization
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2021)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2021)
Documenti analoghi
-
Revisiting Transformers through the Lens of Low Entropy and Dynamic Sparsity
di: Ren, Ruifeng, et al.
Pubblicazione: (2025) -
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025) -
Uncovering Layer-Dependent Activation Sparsity Patterns in ReLU Transformers
di: Wild, Cody, et al.
Pubblicazione: (2024) -
EcoSpa: Efficient Transformer Training with Coupled Sparsity
di: Xiao, Jinqi, et al.
Pubblicazione: (2025) -
Improving Decision Sparsity
di: Sun, Yiyang, et al.
Pubblicazione: (2024)