Hidden Dynamics of Massive Activations in Transformer Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Gallego-Feliciano, Jorge, McClendon, S. Aaron, Morinelli, Juan, Zervoudakis, Stavros, Saravanos, Antonios |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents
di: McClendon, S. Aaron, et al.
Pubblicazione: (2026)
di: McClendon, S. Aaron, et al.
Pubblicazione: (2026)
Reinforcement Learning for Machine Learning Model Deployment: Evaluating Multi-Armed Bandits in ML Ops Environments
di: McClendon, S. Aaron, et al.
Pubblicazione: (2025)
di: McClendon, S. Aaron, et al.
Pubblicazione: (2025)
The Opaque Pointer Design Pattern in Python: Towards a Pythonic PIMPL for Modularity, Encapsulation, and Stability
di: Saravanos, Antonios, et al.
Pubblicazione: (2026)
di: Saravanos, Antonios, et al.
Pubblicazione: (2026)
The Effect of Warm-Glow on User Behavioral Intention to Adopt Technology: Extending the UTAUT2 Model
di: Saravanos, Antonios, et al.
Pubblicazione: (2022)
di: Saravanos, Antonios, et al.
Pubblicazione: (2022)
VR as Library Technology: Early Faculty and Student Feedback on Educational Use of Immersive Technology
di: McClendon, V. J., et al.
Pubblicazione: (2019)
di: McClendon, V. J., et al.
Pubblicazione: (2019)
Gauging Public Acceptance of Conditionally Automated Vehicles in the United States
di: Saravanos, Antonios, et al.
Pubblicazione: (2024)
di: Saravanos, Antonios, et al.
Pubblicazione: (2024)
Prototype Training with Dual Pseudo-Inverse and Optimized Hidden Activations
di: Tucci, Mauro
Pubblicazione: (2025)
di: Tucci, Mauro
Pubblicazione: (2025)
How Warm-Glow Alters the Usability of Technology
di: Saravanos, Antonios
Pubblicazione: (2025)
di: Saravanos, Antonios
Pubblicazione: (2025)
A Brief History of the Waterfall Model: Past, Present, and Future
di: Saravanos, Antonios
Pubblicazione: (2025)
di: Saravanos, Antonios
Pubblicazione: (2025)
Waterfall Model Simulation: A Systematic Mapping Study
di: Saravanos, Antonios
Pubblicazione: (2025)
di: Saravanos, Antonios
Pubblicazione: (2025)
Attention Sinks Induce Gradient Sinks: Massive Activations as Gradient Regulators in Transformers
di: Chen, Yihong, et al.
Pubblicazione: (2026)
di: Chen, Yihong, et al.
Pubblicazione: (2026)
On the Value of Labeled Data and Symbolic Methods for Hidden Neuron Activation Analysis
di: Dalal, Abhilekha, et al.
Pubblicazione: (2024)
di: Dalal, Abhilekha, et al.
Pubblicazione: (2024)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
Training Transformers as a Universal Computer
di: Xu, Ruize, et al.
Pubblicazione: (2026)
di: Xu, Ruize, et al.
Pubblicazione: (2026)
Emergent Low-Rank Training Dynamics in MLPs with Smooth Activations
di: Xu, Alec S., et al.
Pubblicazione: (2026)
di: Xu, Alec S., et al.
Pubblicazione: (2026)
DevNous: An LLM-Based Multi-Agent System for Grounding IT Project Management in Unstructured Conversation
di: Doropoulos, Stavros, et al.
Pubblicazione: (2025)
di: Doropoulos, Stavros, et al.
Pubblicazione: (2025)
Accelerating Transformer Inference and Training with 2:4 Activation Sparsity
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
HodgeFormer: Transformers for Learnable Operators on Triangular Meshes through Data-Driven Hodge Matrices
di: Nousias, Akis, et al.
Pubblicazione: (2025)
di: Nousias, Akis, et al.
Pubblicazione: (2025)
Educational Media and Technology Yearbook, Volume 34
di: Orey, Michael, Ed., et al.
Pubblicazione: (2009)
di: Orey, Michael, Ed., et al.
Pubblicazione: (2009)
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
di: Sun, Shangwen, et al.
Pubblicazione: (2026)
di: Sun, Shangwen, et al.
Pubblicazione: (2026)
Deep FlexQP: Accelerated Nonlinear Programming via Deep Unfolding
di: Oshin, Alex, et al.
Pubblicazione: (2025)
di: Oshin, Alex, et al.
Pubblicazione: (2025)
Dynamic Quality-Diversity Search
di: Gallotta, Roberto, et al.
Pubblicazione: (2024)
di: Gallotta, Roberto, et al.
Pubblicazione: (2024)
On the Role of Hidden States of Modern Hopfield Network in Transformer
di: Masumura, Tsubasa, et al.
Pubblicazione: (2025)
di: Masumura, Tsubasa, et al.
Pubblicazione: (2025)
Genetic Programming with Reinforcement Learning Trained Transformer for Real-World Dynamic Scheduling Problems
di: Chen, Xinan, et al.
Pubblicazione: (2025)
di: Chen, Xinan, et al.
Pubblicazione: (2025)
Error-margin Analysis for Hidden Neuron Activation Labels
di: Dalal, Abhilekha, et al.
Pubblicazione: (2024)
di: Dalal, Abhilekha, et al.
Pubblicazione: (2024)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
Massive Activations in Graph Neural Networks: Decoding Attention for Domain-Dependent Interpretability
di: Bini, Lorenzo, et al.
Pubblicazione: (2024)
di: Bini, Lorenzo, et al.
Pubblicazione: (2024)
Massive Editing for Large Language Models Based on Dynamic Weight Generation
di: Wan, Wentao, et al.
Pubblicazione: (2025)
di: Wan, Wentao, et al.
Pubblicazione: (2025)
Optimizer-Induced Low-Dimensional Drift and Transverse Dynamics in Transformer Training
di: Xu, Yongzhong
Pubblicazione: (2026)
di: Xu, Yongzhong
Pubblicazione: (2026)
Massively Multiagent Minigames for Training Generalist Agents
di: Choe, Kyoung Whan, et al.
Pubblicazione: (2024)
di: Choe, Kyoung Whan, et al.
Pubblicazione: (2024)
Why Gradients Rapidly Increase Near the End of Training
di: Defazio, Aaron
Pubblicazione: (2025)
di: Defazio, Aaron
Pubblicazione: (2025)
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
di: Hao, Yifan, et al.
Pubblicazione: (2025)
di: Hao, Yifan, et al.
Pubblicazione: (2025)
LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of Transformers
di: Razzhigaev, Anton, et al.
Pubblicazione: (2025)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2025)
Layers at Similar Depths Generate Similar Activations Across LLM Architectures
di: Wolfram, Christopher, et al.
Pubblicazione: (2025)
di: Wolfram, Christopher, et al.
Pubblicazione: (2025)
Cracks in The Stack: Hidden Vulnerabilities and Licensing Risks in LLM Pre-Training Datasets
di: Jahanshahi, Mahmoud, et al.
Pubblicazione: (2025)
di: Jahanshahi, Mahmoud, et al.
Pubblicazione: (2025)
A Study on Hidden Layer Distillation for Large Language Model Pre-Training
di: Guigon, Maxime, et al.
Pubblicazione: (2026)
di: Guigon, Maxime, et al.
Pubblicazione: (2026)
How Transformers Learn In-Context Recall Tasks? Optimality, Training Dynamics and Generalization
di: Nguyen, Quan, et al.
Pubblicazione: (2025)
di: Nguyen, Quan, et al.
Pubblicazione: (2025)
Transformer Mechanisms Mimic Frontostriatal Gating Operations When Trained on Human Working Memory Tasks
di: Traylor, Aaron, et al.
Pubblicazione: (2024)
di: Traylor, Aaron, et al.
Pubblicazione: (2024)
Data-Augmentation-Based Dialectal Adaptation for LLMs
di: Faisal, Fahim, et al.
Pubblicazione: (2024)
di: Faisal, Fahim, et al.
Pubblicazione: (2024)
Speaking of Language: Reflections on Metalanguage Research in NLP
di: Schneider, Nathan, et al.
Pubblicazione: (2026)
di: Schneider, Nathan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents
di: McClendon, S. Aaron, et al.
Pubblicazione: (2026) -
Reinforcement Learning for Machine Learning Model Deployment: Evaluating Multi-Armed Bandits in ML Ops Environments
di: McClendon, S. Aaron, et al.
Pubblicazione: (2025) -
The Opaque Pointer Design Pattern in Python: Towards a Pythonic PIMPL for Modularity, Encapsulation, and Stability
di: Saravanos, Antonios, et al.
Pubblicazione: (2026) -
The Effect of Warm-Glow on User Behavioral Intention to Adopt Technology: Extending the UTAUT2 Model
di: Saravanos, Antonios, et al.
Pubblicazione: (2022) -
VR as Library Technology: Early Faculty and Student Feedback on Educational Use of Immersive Technology
di: McClendon, V. J., et al.
Pubblicazione: (2019)