FlashNorm: Fast Normalization for Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Graef, Nils, Makraduli, Filip, Wasielewski, Andrew, Clapp, Matthew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Slim attention: cut your context memory in half without loss -- K-cache is all you need for MHA
di: Graef, Nils, et al.
Pubblicazione: (2025)
di: Graef, Nils, et al.
Pubblicazione: (2025)
Transformer tricks: Precomputing the first layer
di: Graef, Nils
Pubblicazione: (2024)
di: Graef, Nils
Pubblicazione: (2024)
KV-weights are all you need for skipless transformers
di: Graef, Nils
Pubblicazione: (2024)
di: Graef, Nils
Pubblicazione: (2024)
UnitNorm: Rethinking Normalization for Transformers in Time Series
di: Huang, Nan, et al.
Pubblicazione: (2024)
di: Huang, Nan, et al.
Pubblicazione: (2024)
Flash STU: Fast Spectral Transform Units
di: Liu, Y. Isabel, et al.
Pubblicazione: (2024)
di: Liu, Y. Isabel, et al.
Pubblicazione: (2024)
IterL2Norm: Fast Iterative L2-Normalization
di: Ye, ChangMin, et al.
Pubblicazione: (2024)
di: Ye, ChangMin, et al.
Pubblicazione: (2024)
FlashBias: Fast Computation of Attention with Bias
di: Wu, Haixu, et al.
Pubblicazione: (2025)
di: Wu, Haixu, et al.
Pubblicazione: (2025)
FlashKAT: Understanding and Addressing Performance Bottlenecks in the Kolmogorov-Arnold Transformer
di: Raffel, Matthew, et al.
Pubblicazione: (2025)
di: Raffel, Matthew, et al.
Pubblicazione: (2025)
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs
di: Lin, Haoran, et al.
Pubblicazione: (2024)
di: Lin, Haoran, et al.
Pubblicazione: (2024)
Hidden Synergy: $L_1$ Weight Normalization and 1-Path-Norm Regularization
di: Biswas, Aditya
Pubblicazione: (2024)
di: Biswas, Aditya
Pubblicazione: (2024)
Fast and Stable Triangular Inversion for Delta-Rule Linear Transformers
di: Sobczyk, Aleksandros, et al.
Pubblicazione: (2026)
di: Sobczyk, Aleksandros, et al.
Pubblicazione: (2026)
HO-FMN: Hyperparameter Optimization for Fast Minimum-Norm Attacks
di: Mura, Raffaele, et al.
Pubblicazione: (2024)
di: Mura, Raffaele, et al.
Pubblicazione: (2024)
On the Role of Attention Masks and LayerNorm in Transformers
di: Wu, Xinyi, et al.
Pubblicazione: (2024)
di: Wu, Xinyi, et al.
Pubblicazione: (2024)
FlashSampling: Fast and Memory-Efficient Exact Sampling
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
di: Shah, Jay, et al.
Pubblicazione: (2024)
di: Shah, Jay, et al.
Pubblicazione: (2024)
FlashMask: Efficient and Rich Mask Extension of FlashAttention
di: Wang, Guoxia, et al.
Pubblicazione: (2024)
di: Wang, Guoxia, et al.
Pubblicazione: (2024)
PolyNorm: Few-Shot LLM-Based Text Normalization for Text-to-Speech
di: Wong, Michel, et al.
Pubblicazione: (2025)
di: Wong, Michel, et al.
Pubblicazione: (2025)
An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
GAS-Norm: Score-Driven Adaptive Normalization for Non-Stationary Time Series Forecasting in Deep Learning
di: Urettini, Edoardo, et al.
Pubblicazione: (2024)
di: Urettini, Edoardo, et al.
Pubblicazione: (2024)
FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control
di: Kim, Donghu, et al.
Pubblicazione: (2026)
di: Kim, Donghu, et al.
Pubblicazione: (2026)
QuadNorm: Resolution-Robust Normalization for Neural Operators
di: Kim, Bum Jun, et al.
Pubblicazione: (2026)
di: Kim, Bum Jun, et al.
Pubblicazione: (2026)
Flash Invariant Point Attention
di: Liu, Andrew, et al.
Pubblicazione: (2025)
di: Liu, Andrew, et al.
Pubblicazione: (2025)
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
di: Qiu, Haiquan, et al.
Pubblicazione: (2025)
di: Qiu, Haiquan, et al.
Pubblicazione: (2025)
Fast and Unified Path Gradient Estimators for Normalizing Flows
di: Vaitl, Lorenz, et al.
Pubblicazione: (2024)
di: Vaitl, Lorenz, et al.
Pubblicazione: (2024)
Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability
di: Baroni, Luca, et al.
Pubblicazione: (2025)
di: Baroni, Luca, et al.
Pubblicazione: (2025)
Achieving Margin Maximization Exponentially Fast via Progressive Norm Rescaling
di: Wang, Mingze, et al.
Pubblicazione: (2023)
di: Wang, Mingze, et al.
Pubblicazione: (2023)
LayerNorm Induces Recency Bias in Transformer Decoders
di: Kim, Junu, et al.
Pubblicazione: (2025)
di: Kim, Junu, et al.
Pubblicazione: (2025)
Seamlessly Integrating Tree-Based Positional Embeddings into Transformer Models for Source Code Representation
di: Bartkowiak, Patryk, et al.
Pubblicazione: (2025)
di: Bartkowiak, Patryk, et al.
Pubblicazione: (2025)
FlashTex: Fast Relightable Mesh Texturing with LightControlNet
di: Deng, Kangle, et al.
Pubblicazione: (2024)
di: Deng, Kangle, et al.
Pubblicazione: (2024)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
di: Qiao, Liang, et al.
Pubblicazione: (2025)
di: Qiao, Liang, et al.
Pubblicazione: (2025)
INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
di: Chen, Shimao, et al.
Pubblicazione: (2024)
di: Chen, Shimao, et al.
Pubblicazione: (2024)
Learning in Compact Spaces with Approximately Normalized Transformer
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
On the Importance of Embedding Norms in Self-Supervised Learning
di: Draganov, Andrew, et al.
Pubblicazione: (2025)
di: Draganov, Andrew, et al.
Pubblicazione: (2025)
Signs of the Past, Patterns of the Present: On the Automatic Classification of Old Babylonian Cuneiform Signs
di: Verwimp, Eli, et al.
Pubblicazione: (2025)
di: Verwimp, Eli, et al.
Pubblicazione: (2025)
FlashSchNet: Fast and Accurate Coarse-Grained Neural Network Molecular Dynamics
di: Li, Pingzhi, et al.
Pubblicazione: (2026)
di: Li, Pingzhi, et al.
Pubblicazione: (2026)
GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization
di: Zheng, Chuanyang, et al.
Pubblicazione: (2026)
di: Zheng, Chuanyang, et al.
Pubblicazione: (2026)
Subcritical Signal Propagation at Initialization in Normalization-Free Transformers
di: Alekseev, Sergey
Pubblicazione: (2026)
di: Alekseev, Sergey
Pubblicazione: (2026)
Normalized Matching Transformer
di: Pourhadi, Abtin, et al.
Pubblicazione: (2025)
di: Pourhadi, Abtin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Slim attention: cut your context memory in half without loss -- K-cache is all you need for MHA
di: Graef, Nils, et al.
Pubblicazione: (2025) -
Transformer tricks: Precomputing the first layer
di: Graef, Nils
Pubblicazione: (2024) -
KV-weights are all you need for skipless transformers
di: Graef, Nils
Pubblicazione: (2024) -
UnitNorm: Rethinking Normalization for Transformers in Time Series
di: Huang, Nan, et al.
Pubblicazione: (2024) -
Flash STU: Fast Spectral Transform Units
di: Liu, Y. Isabel, et al.
Pubblicazione: (2024)