BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Jiayi, Shinn, Cameron, Xu, Kai, Cui, Jingze, Klimiashvili, George, Xiao, Guangxuan, Zheng, Perkz, Li, Bo, Zhou, Yuxin, Ye, Zhouhai, You, Weijie, Zheng, Tian, Brown, Dominic, Wang, Pengbo, Hoehnerbach, Markus, Cai, Richard, Demouth, Julien, Owens, John D., Hu, Xia, Han, Song, Liu, Timmy, Mao, Huizi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
di: Zadouri, Ted, et al.
Pubblicazione: (2026)
di: Zadouri, Ted, et al.
Pubblicazione: (2026)
What Does Softmax Probability Tell Us about Classifiers Ranking Across Diverse Test Conditions?
di: Tu, Weijie, et al.
Pubblicazione: (2024)
di: Tu, Weijie, et al.
Pubblicazione: (2024)
BLaST: High Performance Inference and Pretraining using BLock Sparse Transformers
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
Intrinsic and Extrinsic Organized Attention: Softmax Invariance and Network Sparsity
di: Fasina, Oluwadamilola, et al.
Pubblicazione: (2025)
di: Fasina, Oluwadamilola, et al.
Pubblicazione: (2025)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
di: Tang, Jiaming, et al.
Pubblicazione: (2024)
di: Tang, Jiaming, et al.
Pubblicazione: (2024)
Many-to-Many Matching via Sparsity Controlled Optimal Transport
di: Liu, Weijie, et al.
Pubblicazione: (2025)
di: Liu, Weijie, et al.
Pubblicazione: (2025)
Self-Adjust Softmax
di: Zheng, Chuanyang, et al.
Pubblicazione: (2025)
di: Zheng, Chuanyang, et al.
Pubblicazione: (2025)
Scalar Coherence Geometry: A Classical Reproduction of the CMB Power Spectrum Without Expansion or Inflation
di: Shinn, Mark
Pubblicazione: (2025)
di: Shinn, Mark
Pubblicazione: (2025)
Scalar Field Geometry of Time, Causal Boundaries, and Gravitational Observables
di: Shinn, Mark
Pubblicazione: (2025)
di: Shinn, Mark
Pubblicazione: (2025)
A Home Away from Home: Libraries & Homeschoolers
di: Shinn, Lora
Pubblicazione: (2008)
di: Shinn, Lora
Pubblicazione: (2008)
State Scholarship Program Impact
di: Shinn, Sydniciel
Pubblicazione: (1972)
di: Shinn, Sydniciel
Pubblicazione: (1972)
Toward Uniformity in Exchange Communication
di: Shinn, Isabella
Pubblicazione: (1972)
di: Shinn, Isabella
Pubblicazione: (1972)
Jerarquías de investigadores y formas de investigación
di: Terry Shinn
Pubblicazione: (2007)
di: Terry Shinn
Pubblicazione: (2007)
Debate: en torno a La nueva producción de conocimiento y la Triple hélice
di: Terry Shinn
Pubblicazione: (2002)
di: Terry Shinn
Pubblicazione: (2002)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
di: Huang, Weizhong, et al.
Pubblicazione: (2025)
di: Huang, Weizhong, et al.
Pubblicazione: (2025)
Rethinking Attention: Polynomial Alternatives to Softmax in Transformers
di: Saratchandran, Hemanth, et al.
Pubblicazione: (2024)
di: Saratchandran, Hemanth, et al.
Pubblicazione: (2024)
Proven Advantage of Multiobjective Evolutionary Algorithms for Problems with Different Degrees of Conflict
di: Zheng, Weijie
Pubblicazione: (2024)
di: Zheng, Weijie
Pubblicazione: (2024)
On Softmax Direct Preference Optimization for Recommendation
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
Bootstrapping OTS-Funcimg Pre-training Model (Botfip) -- A Comprehensive Symbolic Regression Framework
di: Chen, Tianhao, et al.
Pubblicazione: (2024)
di: Chen, Tianhao, et al.
Pubblicazione: (2024)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
di: Lee, Donghyun, et al.
Pubblicazione: (2024)
di: Lee, Donghyun, et al.
Pubblicazione: (2024)
El juego de la vida / Florence Scovel Shinn
di: Scovel Shinn, Florence
di: Scovel Shinn, Florence
A three-term Polak-Ribière-Polyak conjugate gradient method for vector optimization
di: Lin, Guangxuan, et al.
Pubblicazione: (2025)
di: Lin, Guangxuan, et al.
Pubblicazione: (2025)
Adaptive Sparse Softmax: An Effective and Efficient Softmax Variant
di: Lv, Qi, et al.
Pubblicazione: (2025)
di: Lv, Qi, et al.
Pubblicazione: (2025)
On the Identifiability of Nonlinear ICA: Sparsity and Beyond
di: Zheng, Yujia, et al.
Pubblicazione: (2022)
di: Zheng, Yujia, et al.
Pubblicazione: (2022)
Institutional attention and investment efficiency
di: Jiayi Zheng
Pubblicazione: (2024)
di: Jiayi Zheng
Pubblicazione: (2024)
Sim2Real Deep Transfer for Per-Device CFO Calibration
di: Zheng, Jingze, et al.
Pubblicazione: (2026)
di: Zheng, Jingze, et al.
Pubblicazione: (2026)
Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies
di: Song, Jingze, et al.
Pubblicazione: (2026)
di: Song, Jingze, et al.
Pubblicazione: (2026)
Stochastic Variance-Reduced Iterative Hard Thresholding in Graph Sparsity Optimization
di: Fox, Derek, et al.
Pubblicazione: (2024)
di: Fox, Derek, et al.
Pubblicazione: (2024)
When Softmax Fails at the Top: Extreme Value Corrections for InfoNCE
di: Erol, Melihcan, et al.
Pubblicazione: (2026)
di: Erol, Melihcan, et al.
Pubblicazione: (2026)
An experimental analysis of the effects of dietary lipid sources and feeding ration on the reproductive performance, egg and larval quality of Nile tilapia, Oreochromis niloticus (L.)
di: Hajizadeh, A., et al.
Pubblicazione: (2016)
di: Hajizadeh, A., et al.
Pubblicazione: (2016)
chat log: Goolge Search AI - Anthropic Claude benchmarks and model release statistics in comparison to PACAD-based training estimates
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
PACAD-Enhanced Opus: Specialized Benchmark Performance Estimates – 2-3 Week Cycle (14-21 Days, Median ~17 Days)
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
DIR Tier Specification v0.1 Derivation and Integration Results Layer
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
chat log: Claude AI - discussing KV Cache Architecture translation, along with Operational Containment Multi-Engine (OCME) and ORISOM-QC specs and development
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
RML / RLM Charter v0.1 Relational Mathematics Logic / Relational Logic Mathematics
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
PACAD-Based Structural Reasoning for AGI: From Probabilistic Pattern-Matching to Verifiable Canonical Architectures – paper 1, version 1
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
PACAD-Based Structural Reasoning for AGI: From Probabilistic Pattern-Matching to Verifiable Canonical Architectures – paper 1, version 2
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
Reading the Machine From Outside: A Non-Invasive AI Monitoring Architecture Grounded in Neural Decoding, Layered Residual Geometry, and the Ghost DNA Principle
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
AEC — Axiomatic Engine Cycle v0.1 — Initial Specification Draft
di: Brown, Cameron
Pubblicazione: (2026)
di: Brown, Cameron
Pubblicazione: (2026)
Documenti analoghi
-
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022) -
FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
di: Zadouri, Ted, et al.
Pubblicazione: (2026) -
What Does Softmax Probability Tell Us about Classifiers Ranking Across Diverse Test Conditions?
di: Tu, Weijie, et al.
Pubblicazione: (2024) -
BLaST: High Performance Inference and Pretraining using BLock Sparse Transformers
di: Okanovic, Patrik, et al.
Pubblicazione: (2025) -
Intrinsic and Extrinsic Organized Attention: Softmax Invariance and Network Sparsity
di: Fasina, Oluwadamilola, et al.
Pubblicazione: (2025)