Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Jingyang, Gao, Huazuo, Dai, Damai, Luo, Junyu, Zhao, Liang, Zhang, Zhengyan, Xie, Zhenda, Wei, Y. X., Wang, Lean, Xiao, Zhiping, Wang, Yuqing, Ruan, Chong, Zhang, Ming, Liang, Wenfeng, Zeng, Wangding |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Natively Trainable Sparse Attention for Hierarchical Point Cloud Datasets
di: Lapautre, Nicolas, et al.
Pubblicazione: (2025)
di: Lapautre, Nicolas, et al.
Pubblicazione: (2025)
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
di: Xu, Boxun, et al.
Pubblicazione: (2026)
di: Xu, Boxun, et al.
Pubblicazione: (2026)
mHC: Manifold-Constrained Hyper-Connections
di: Xie, Zhenda, et al.
Pubblicazione: (2025)
di: Xie, Zhenda, et al.
Pubblicazione: (2025)
NOSA: Native and Offloadable Sparse Attention
di: Huang, Yuxiang, et al.
Pubblicazione: (2025)
di: Huang, Yuxiang, et al.
Pubblicazione: (2025)
Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
di: Wang, Lean, et al.
Pubblicazione: (2024)
di: Wang, Lean, et al.
Pubblicazione: (2024)
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
di: Zhao, Chenggang, et al.
Pubblicazione: (2025)
di: Zhao, Chenggang, et al.
Pubblicazione: (2025)
Trainable Dynamic Mask Sparse Attention
di: Shi, Jingze, et al.
Pubblicazione: (2025)
di: Shi, Jingze, et al.
Pubblicazione: (2025)
Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
di: Dai, Damai, et al.
Pubblicazione: (2024)
di: Dai, Damai, et al.
Pubblicazione: (2024)
VSA: Faster Video Diffusion with Trainable Sparse Attention
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
VideoNSA: Native Sparse Attention Scales Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
Punctuation-aware Hybrid Trainable Sparse Attention for Large Language Models
di: Qiu, Junxiang, et al.
Pubblicazione: (2026)
di: Qiu, Junxiang, et al.
Pubblicazione: (2026)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
di: Xiu, Di, et al.
Pubblicazione: (2025)
di: Xiu, Di, et al.
Pubblicazione: (2025)
TabNSA: Native Sparse Attention for Efficient Tabular Data Learning
di: Eslamian, Ali, et al.
Pubblicazione: (2025)
di: Eslamian, Ali, et al.
Pubblicazione: (2025)
Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
di: Cheng, Xin, et al.
Pubblicazione: (2026)
di: Cheng, Xin, et al.
Pubblicazione: (2026)
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
Rectified Sparse Attention
di: Sun, Yutao, et al.
Pubblicazione: (2025)
di: Sun, Yutao, et al.
Pubblicazione: (2025)
PowerAttention: Exponentially Scaling of Receptive Fields for Effective Sparse Attention
di: Chen, Lida, et al.
Pubblicazione: (2025)
di: Chen, Lida, et al.
Pubblicazione: (2025)
Attention Bootstrapping for Multi-Modal Test-Time Adaptation
di: Zhao, Yusheng, et al.
Pubblicazione: (2025)
di: Zhao, Yusheng, et al.
Pubblicazione: (2025)
SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
Native Hybrid Attention for Efficient Sequence Modeling
di: Du, Jusen, et al.
Pubblicazione: (2025)
di: Du, Jusen, et al.
Pubblicazione: (2025)
FASA: Frequency-aware Sparse Attention
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
Improving Sparse Autoencoder with Dynamic Attention
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
HSR-Enhanced Sparse Attention Acceleration
di: Chen, Bo, et al.
Pubblicazione: (2024)
di: Chen, Bo, et al.
Pubblicazione: (2024)
Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse
di: Fu, Zizhuo, et al.
Pubblicazione: (2026)
di: Fu, Zizhuo, et al.
Pubblicazione: (2026)
SPLA: Block Sparse Plus Linear Attention for Long Context Modeling
di: Wang, Bailin, et al.
Pubblicazione: (2026)
di: Wang, Bailin, et al.
Pubblicazione: (2026)
SparseD: Sparse Attention for Diffusion Language Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
Native 3D Editing with Full Attention
di: Cai, Weiwei, et al.
Pubblicazione: (2025)
di: Cai, Weiwei, et al.
Pubblicazione: (2025)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
di: Qiao, Liang, et al.
Pubblicazione: (2025)
di: Qiao, Liang, et al.
Pubblicazione: (2025)
SeerAttention-R: Sparse Attention Adaptation for Long Reasoning
di: Gao, Yizhao, et al.
Pubblicazione: (2025)
di: Gao, Yizhao, et al.
Pubblicazione: (2025)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
di: Yang, Zhicheng, et al.
Pubblicazione: (2023)
di: Yang, Zhicheng, et al.
Pubblicazione: (2023)
AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing
di: Gao, Yizhao, et al.
Pubblicazione: (2026)
di: Gao, Yizhao, et al.
Pubblicazione: (2026)
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
di: Li, Wenxuan, et al.
Pubblicazione: (2025)
di: Li, Wenxuan, et al.
Pubblicazione: (2025)
Lag-Relative Sparse Attention In Long Context Training
di: Liang, Manlai, et al.
Pubblicazione: (2025)
di: Liang, Manlai, et al.
Pubblicazione: (2025)
vAttention: Verified Sparse Attention
di: Desai, Aditya, et al.
Pubblicazione: (2025)
di: Desai, Aditya, et al.
Pubblicazione: (2025)
How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse
di: Deng, Yichuan, et al.
Pubblicazione: (2024)
di: Deng, Yichuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Natively Trainable Sparse Attention for Hierarchical Point Cloud Datasets
di: Lapautre, Nicolas, et al.
Pubblicazione: (2025) -
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
di: Xu, Boxun, et al.
Pubblicazione: (2026) -
mHC: Manifold-Constrained Hyper-Connections
di: Xie, Zhenda, et al.
Pubblicazione: (2025) -
NOSA: Native and Offloadable Sparse Attention
di: Huang, Yuxiang, et al.
Pubblicazione: (2025) -
Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
di: Wang, Lean, et al.
Pubblicazione: (2024)