VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Yupeng, Li, Yanzhao, Zou, Zhiqiang, Du, Bai, Zhang, Zhiyuan, Dong, Hui, Fan, Gaoyige, Wang, Hui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
por: Zhang, Zhiyuan, et al.
Publicado: (2026)
por: Zhang, Zhiyuan, et al.
Publicado: (2026)
INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
por: Chen, Shimao, et al.
Publicado: (2024)
por: Chen, Shimao, et al.
Publicado: (2024)
AMLA: MUL by ADD in FlashAttention Rescaling
por: Liao, Qichen, et al.
Publicado: (2025)
por: Liao, Qichen, et al.
Publicado: (2025)
Flash Invariant Point Attention
por: Liu, Andrew, et al.
Publicado: (2025)
por: Liu, Andrew, et al.
Publicado: (2025)
Fourier Asymmetric Attention on Domain Generalization for Pan-Cancer Drug Response Prediction
por: Song, Ran, et al.
Publicado: (2025)
por: Song, Ran, et al.
Publicado: (2025)
FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
por: Shah, Jay, et al.
Publicado: (2024)
por: Shah, Jay, et al.
Publicado: (2024)
Enhancing Training Efficiency Using Packing with Flash Attention
por: Kundu, Achintya, et al.
Publicado: (2024)
por: Kundu, Achintya, et al.
Publicado: (2024)
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
por: Sharma, Agniv, et al.
Publicado: (2024)
por: Sharma, Agniv, et al.
Publicado: (2024)
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
por: Qiu, Haiquan, et al.
Publicado: (2025)
por: Qiu, Haiquan, et al.
Publicado: (2025)
FLASH-D: FlashAttention with Hidden Softmax Division
por: Alexandridis, Kosmas, et al.
Publicado: (2025)
por: Alexandridis, Kosmas, et al.
Publicado: (2025)
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
por: De Schouwer, Jonas, et al.
Publicado: (2026)
por: De Schouwer, Jonas, et al.
Publicado: (2026)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
por: Qiao, Liang, et al.
Publicado: (2025)
por: Qiao, Liang, et al.
Publicado: (2025)
Tiled Flash Linear Attention: More Efficient Linear RNN and xLSTM Kernels
por: Beck, Maximilian, et al.
Publicado: (2025)
por: Beck, Maximilian, et al.
Publicado: (2025)
TripleSurv: Triplet Time-adaptive Coordinate Loss for Survival Analysis
por: Zhang, Liwen, et al.
Publicado: (2024)
por: Zhang, Liwen, et al.
Publicado: (2024)
Learning Dynamic Representations via An Optimally-Weighted Maximum Mean Discrepancy Optimization Framework for Continual Learning
por: Huang, KaiHui, et al.
Publicado: (2025)
por: Huang, KaiHui, et al.
Publicado: (2025)
Improving Sparse Autoencoder with Dynamic Attention
por: Wang, Dongsheng, et al.
Publicado: (2026)
por: Wang, Dongsheng, et al.
Publicado: (2026)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
por: Tan, Zezhong, et al.
Publicado: (2025)
por: Tan, Zezhong, et al.
Publicado: (2025)
Singular Vectors of Attention Heads Align with Features
por: Franco, Gabriel, et al.
Publicado: (2026)
por: Franco, Gabriel, et al.
Publicado: (2026)
VectorFit : Adaptive Singular & Bias Vector Fine-Tuning of Pre-trained Foundation Models
por: Hegde, Suhas G, et al.
Publicado: (2025)
por: Hegde, Suhas G, et al.
Publicado: (2025)
Cellular Traffic Prediction via Deep State Space Models with Attention Mechanism
por: Ma, Hui, et al.
Publicado: (2025)
por: Ma, Hui, et al.
Publicado: (2025)
Enhancing Performance and Scalability of Large-Scale Recommendation Systems with Jagged Flash Attention
por: Xu, Rengan, et al.
Publicado: (2024)
por: Xu, Rengan, et al.
Publicado: (2024)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
por: Li, Zeqiao, et al.
Publicado: (2026)
por: Li, Zeqiao, et al.
Publicado: (2026)
Physics-informed Attention-enhanced Fourier Neural Operator for Solar Magnetic Field Extrapolations
por: Cao, Jinghao, et al.
Publicado: (2025)
por: Cao, Jinghao, et al.
Publicado: (2025)
Multi-branch of Attention Yields Accurate Results for Tabular Data
por: Li, Xuechen, et al.
Publicado: (2025)
por: Li, Xuechen, et al.
Publicado: (2025)
Escaping Optimization Stagnation: Taking Steps Beyond Task Arithmetic via Difference Vectors
por: Wang, Jinping, et al.
Publicado: (2025)
por: Wang, Jinping, et al.
Publicado: (2025)
Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
por: Dhayalkar, Sahil Rajesh
Publicado: (2025)
por: Dhayalkar, Sahil Rajesh
Publicado: (2025)
Generalized Attention Flow: Feature Attribution for Transformer Models via Maximum Flow
por: Azarkhalili, Behrooz, et al.
Publicado: (2025)
por: Azarkhalili, Behrooz, et al.
Publicado: (2025)
Representation Collapsing Problems in Vector Quantization
por: Zhao, Wenhao, et al.
Publicado: (2024)
por: Zhao, Wenhao, et al.
Publicado: (2024)
Graph-Based Physics-Guided Urban PM2.5 Air Quality Imputation with Constrained Monitoring Data
por: Du, Shangjie, et al.
Publicado: (2025)
por: Du, Shangjie, et al.
Publicado: (2025)
Geometric Attention: A Regime-Explicit Operator Semantics for Transformer Attention
por: Freytes, Luis Rosario
Publicado: (2026)
por: Freytes, Luis Rosario
Publicado: (2026)
Generalized Population-Based Training for Hyperparameter Optimization in Reinforcement Learning
por: Bai, Hui, et al.
Publicado: (2024)
por: Bai, Hui, et al.
Publicado: (2024)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
por: Ye, Zihao, et al.
Publicado: (2025)
por: Ye, Zihao, et al.
Publicado: (2025)
Enhancing Multivariate Time Series Forecasting with Global Temporal Retrieval
por: Cao, Fanpu, et al.
Publicado: (2026)
por: Cao, Fanpu, et al.
Publicado: (2026)
Variational Task Vector Composition
por: Zhang, Boyuan, et al.
Publicado: (2025)
por: Zhang, Boyuan, et al.
Publicado: (2025)
Global-Lens Transformers: Adaptive Token Mixing for Dynamic Link Prediction
por: Zou, Tao, et al.
Publicado: (2025)
por: Zou, Tao, et al.
Publicado: (2025)
Unleashing The Power of Pre-Trained Language Models for Irregularly Sampled Time Series
por: Zhang, Weijia, et al.
Publicado: (2024)
por: Zhang, Weijia, et al.
Publicado: (2024)
Kaczmarz Linear Attention
por: Zou, Jiaxuan, et al.
Publicado: (2026)
por: Zou, Jiaxuan, et al.
Publicado: (2026)
A Joint Learning Model with Variational Interaction for Multilingual Program Translation
por: Du, Yali, et al.
Publicado: (2024)
por: Du, Yali, et al.
Publicado: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
por: Shao, Zishan, et al.
Publicado: (2025)
por: Shao, Zishan, et al.
Publicado: (2025)
Maximum Entropy Reinforcement Learning with Diffusion Policy
por: Dong, Xiaoyi, et al.
Publicado: (2025)
por: Dong, Xiaoyi, et al.
Publicado: (2025)
Ejemplares similares
-
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
por: Zhang, Zhiyuan, et al.
Publicado: (2026) -
INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
por: Chen, Shimao, et al.
Publicado: (2024) -
AMLA: MUL by ADD in FlashAttention Rescaling
por: Liao, Qichen, et al.
Publicado: (2025) -
Flash Invariant Point Attention
por: Liu, Andrew, et al.
Publicado: (2025) -
Fourier Asymmetric Attention on Domain Generalization for Pan-Cancer Drug Response Prediction
por: Song, Ran, et al.
Publicado: (2025)