Dynamic Sparse Attention: Access Patterns and Architecture
Fuente:
arXiv
Salvato in:
| Autore principale: | Levy, Noam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
di: Wang, Hanrui, et al.
Pubblicazione: (2020)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
di: Kang, Hao, et al.
Pubblicazione: (2024)
di: Kang, Hao, et al.
Pubblicazione: (2024)
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
di: Kim, Taehyun, et al.
Pubblicazione: (2024)
di: Kim, Taehyun, et al.
Pubblicazione: (2024)
FLASH-D: FlashAttention with Hidden Softmax Division
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
MonoSparse-CAM: Efficient Tree Model Processing via Monotonicity and Sparsity in CAMs
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2024)
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2024)
Hardware/Software Co-Design of RISC-V Extensions for Accelerating Sparse DNNs on FPGAs
di: Sabih, Muhammad, et al.
Pubblicazione: (2025)
di: Sabih, Muhammad, et al.
Pubblicazione: (2025)
The Role of Advanced Computer Architectures in Accelerating Artificial Intelligence Workloads
di: Amin, Shahid, et al.
Pubblicazione: (2025)
di: Amin, Shahid, et al.
Pubblicazione: (2025)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
Revolutionizing TCAD Simulations with Universal Device Encoding and Graph Attention Networks
di: Fan, Guangxi, et al.
Pubblicazione: (2023)
di: Fan, Guangxi, et al.
Pubblicazione: (2023)
QuArch: A Question-Answering Dataset for AI Agents in Computer Architecture
di: Prakash, Shvetank, et al.
Pubblicazione: (2025)
di: Prakash, Shvetank, et al.
Pubblicazione: (2025)
Self-Attention to Operator Learning-based 3D-IC Thermal Simulation
di: Huang, Zhen, et al.
Pubblicazione: (2025)
di: Huang, Zhen, et al.
Pubblicazione: (2025)
From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic
di: Ren, Hansheng
Pubblicazione: (2026)
di: Ren, Hansheng
Pubblicazione: (2026)
VUSA: Virtually Upscaled Systolic Array Architecture to Exploit Unstructured Sparsity in AI Acceleration
di: Helal, Shereef, et al.
Pubblicazione: (2025)
di: Helal, Shereef, et al.
Pubblicazione: (2025)
Multi-objective Optimization in CPU Design Space Exploration: Attention is All You Need
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
MEMHD: Memory-Efficient Multi-Centroid Hyperdimensional Computing for Fully-Utilized In-Memory Computing Architectures
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
AIM: Software and Hardware Co-design for Architecture-level IR-drop Mitigation in High-performance PIM
di: Zhang, Yuanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Yuanpeng, et al.
Pubblicazione: (2025)
tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI
di: Nair, Harideep, et al.
Pubblicazione: (2024)
di: Nair, Harideep, et al.
Pubblicazione: (2024)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
Efficient Data Access Paths for Mixed Vector-Relational Search
di: Sanca, Viktor, et al.
Pubblicazione: (2024)
di: Sanca, Viktor, et al.
Pubblicazione: (2024)
Enabling Physical AI at the Edge: Hardware-Accelerated Recovery of System Dynamics
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
Dynamic Co-Optimization Compiler: Leveraging Multi-Agent Reinforcement Learning for Enhanced DNN Accelerator Performance
di: Fayyazi, Arya, et al.
Pubblicazione: (2024)
di: Fayyazi, Arya, et al.
Pubblicazione: (2024)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
NVR: Vector Runahead on NPUs for Sparse Memory Access
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning
di: Sudusinghe, Chamika, et al.
Pubblicazione: (2025)
di: Sudusinghe, Chamika, et al.
Pubblicazione: (2025)
Sorted Weight Sectioning for Energy-Efficient Unstructured Sparse DNNs on Compute-in-Memory Crossbars
di: Farias, Matheus, et al.
Pubblicazione: (2024)
di: Farias, Matheus, et al.
Pubblicazione: (2024)
In-Memory Learning Automata Architecture using Y-Flash Cell
di: Ghazal, Omar, et al.
Pubblicazione: (2024)
di: Ghazal, Omar, et al.
Pubblicazione: (2024)
QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture
di: Prakash, Shvetank, et al.
Pubblicazione: (2025)
di: Prakash, Shvetank, et al.
Pubblicazione: (2025)
Cocoon: A System Architecture for Differentially Private Training with Correlated Noises
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
FlexLLM: Composable HLS Library for Flexible Hybrid LLM Accelerator Design
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
Causal AI For AMS Circuit Design: Interpretable Parameter Effects Analysis
di: Hussain, Mohyeu, et al.
Pubblicazione: (2026)
di: Hussain, Mohyeu, et al.
Pubblicazione: (2026)
Design Rules for Extreme-Edge Scientific Computing on AI Engines
di: Ma, Zhenghua, et al.
Pubblicazione: (2026)
di: Ma, Zhenghua, et al.
Pubblicazione: (2026)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?
di: Bhandwaldar, Abhishek, et al.
Pubblicazione: (2026)
di: Bhandwaldar, Abhishek, et al.
Pubblicazione: (2026)
TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators
di: Meng, Chang, et al.
Pubblicazione: (2026)
di: Meng, Chang, et al.
Pubblicazione: (2026)
Position Paper: From Edge AI to Adaptive Edge AI
di: Pittorino, Fabrizio, et al.
Pubblicazione: (2026)
di: Pittorino, Fabrizio, et al.
Pubblicazione: (2026)
Graph Computation Meets Circuit Algebra: A Task-Aligned Analysis of Graph Neural Networks for Electronic Design Automation
di: Kim, Hyunmog
Pubblicazione: (2026)
di: Kim, Hyunmog
Pubblicazione: (2026)
CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement
di: Mhapsekar, Kaushal, et al.
Pubblicazione: (2026)
di: Mhapsekar, Kaushal, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
di: Wang, Hanrui, et al.
Pubblicazione: (2020) -
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024) -
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
di: Kang, Hao, et al.
Pubblicazione: (2024) -
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
di: Kim, Taehyun, et al.
Pubblicazione: (2024) -
FLASH-D: FlashAttention with Hidden Softmax Division
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)