Hardware-Centric Analysis of DeepSeek's Multi-Head Latent Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Geens, Robin, Verhelst, Marian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
par: Geens, Robin, et autres
Publié: (2026)
par: Geens, Robin, et autres
Publié: (2026)
Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration
par: Geens, Robin, et autres
Publié: (2025)
par: Geens, Robin, et autres
Publié: (2025)
The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency
par: Geens, Robin, et autres
Publié: (2026)
par: Geens, Robin, et autres
Publié: (2026)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
par: Dumoulin, Joren, et autres
Publié: (2025)
par: Dumoulin, Joren, et autres
Publié: (2025)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
par: Fang, Chao, et autres
Publié: (2024)
par: Fang, Chao, et autres
Publié: (2024)
Efficient Precision-Scalable Hardware for Microscaling (MX) Processing in Robotics Learning
par: Cuyckens, Stef, et autres
Publié: (2025)
par: Cuyckens, Stef, et autres
Publié: (2025)
How to keep pushing ML accelerator performance? Know your rooflines!
par: Verhelst, Marian, et autres
Publié: (2025)
par: Verhelst, Marian, et autres
Publié: (2025)
Precision-Scalable Microscaling Datapaths with Optimized Reduction Tree for Efficient NPU Integration
par: Cuyckens, Stef, et autres
Publié: (2025)
par: Cuyckens, Stef, et autres
Publié: (2025)
Optimizing Layer-Fused Scheduling of Transformer Networks on Multi-accelerator Platforms
par: Colleman, Steven, et autres
Publié: (2024)
par: Colleman, Steven, et autres
Publié: (2024)
Optimising GPGPU Execution Through Runtime Micro-Architecture Parameter Analysis
par: Sarda, Giuseppe M., et autres
Publié: (2024)
par: Sarda, Giuseppe M., et autres
Publié: (2024)
Pack my weights and run! Minimizing overheads for in-memory computing accelerators
par: Houshmand, Pouya, et autres
Publié: (2024)
par: Houshmand, Pouya, et autres
Publié: (2024)
Decoupled Control Flow and Data Access in RISC-V GPGPUs
par: Sarda, Giuseppe M., et autres
Publié: (2025)
par: Sarda, Giuseppe M., et autres
Publié: (2025)
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
par: Zhao, Chenggang, et autres
Publié: (2025)
par: Zhao, Chenggang, et autres
Publié: (2025)
Hardware-Algorithm Co-Optimization of Early-Exit Neural Networks for Multi-Core Edge Accelerators
par: Zniber, Alaa, et autres
Publié: (2025)
par: Zniber, Alaa, et autres
Publié: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
par: Yi, Xiaoling, et autres
Publié: (2025)
par: Yi, Xiaoling, et autres
Publié: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
par: Symons, Arne, et autres
Publié: (2022)
par: Symons, Arne, et autres
Publié: (2022)
iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator
par: Cuyckens, Stef, et autres
Publié: (2025)
par: Cuyckens, Stef, et autres
Publié: (2025)
A 16 nm 1.60TOPS/W High Utilization DNN Accelerator with 3D Spatial Data Reuse and Efficient Shared Memory Access
par: Yi, Xiaoling, et autres
Publié: (2026)
par: Yi, Xiaoling, et autres
Publié: (2026)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
par: Zhao, Shirui, et autres
Publié: (2025)
par: Zhao, Shirui, et autres
Publié: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding
par: Zhang, Junming, et autres
Publié: (2026)
par: Zhang, Junming, et autres
Publié: (2026)
Analog or Digital In-memory Computing? Benchmarking through Quantitative Modeling
par: Sun, Jiacong, et autres
Publié: (2024)
par: Sun, Jiacong, et autres
Publié: (2024)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025)
par: Kong, Fanchen, et autres
Publié: (2025)
An Open-Source HW-SW Co-Development Framework Enabling Efficient Multi-Accelerator Systems
par: Antonio, Ryan Albert, et autres
Publié: (2025)
par: Antonio, Ryan Albert, et autres
Publié: (2025)
SALSA: Simulated Annealing based Loop-Ordering Scheduler for DNN Accelerators
par: Jung, Victor J. B., et autres
Publié: (2023)
par: Jung, Victor J. B., et autres
Publié: (2023)
FloorPlan-DeepSeek (FPDS): A multimodal approach to floorplan generation using vector-based next room prediction
par: Yin, Jun, et autres
Publié: (2025)
par: Yin, Jun, et autres
Publié: (2025)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
par: Mei, Linyan, et autres
Publié: (2022)
par: Mei, Linyan, et autres
Publié: (2022)
H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
par: Alexandridis, Kosmas, et autres
Publié: (2025)
par: Alexandridis, Kosmas, et autres
Publié: (2025)
StruM: Structured Mixed Precision for Efficient Deep Learning Hardware Codesign
par: Wu, Michael, et autres
Publié: (2025)
par: Wu, Michael, et autres
Publié: (2025)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
par: Das, Abhijit, et autres
Publié: (2022)
par: Das, Abhijit, et autres
Publié: (2022)
Design and Analysis of Approximate Hardware Accelerators for VVC Intra Angular Prediction
par: de Fraga, Lucas M. Leipnitz, et autres
Publié: (2025)
par: de Fraga, Lucas M. Leipnitz, et autres
Publié: (2025)
OpenGeMM: A High-Utilization GeMM Accelerator Generator with Lightweight RISC-V Control and Tight Memory Coupling
par: Yi, Xiaoling, et autres
Publié: (2024)
par: Yi, Xiaoling, et autres
Publié: (2024)
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
par: Deng, Yunhao, et autres
Publié: (2025)
par: Deng, Yunhao, et autres
Publié: (2025)
Sustainable Hardware Specialization
par: Dangi, Pranav, et autres
Publié: (2024)
par: Dangi, Pranav, et autres
Publié: (2024)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
par: Raj, Ritik, et autres
Publié: (2025)
par: Raj, Ritik, et autres
Publié: (2025)
Marco: Configurable Graph-Based Task Solving and Multi-AI Agents Framework for Hardware Design
par: Ho, Chia-Tung, et autres
Publié: (2025)
par: Ho, Chia-Tung, et autres
Publié: (2025)
AssertLLM: Generating Hardware Verification Assertions from Design Specifications via Multi-LLMs
par: Yan, Zhiyuan, et autres
Publié: (2024)
par: Yan, Zhiyuan, et autres
Publié: (2024)
AssertLLM: Generating and Evaluating Hardware Verification Assertions from Design Specifications via Multi-LLMs
par: Fang, Wenji, et autres
Publié: (2024)
par: Fang, Wenji, et autres
Publié: (2024)
Swapping-Centric Neural Recording Systems
par: Ugur, Muhammed, et autres
Publié: (2024)
par: Ugur, Muhammed, et autres
Publié: (2024)
Documents similaires
-
Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
par: Geens, Robin, et autres
Publié: (2026) -
Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration
par: Geens, Robin, et autres
Publié: (2025) -
The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency
par: Geens, Robin, et autres
Publié: (2026) -
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
par: Dumoulin, Joren, et autres
Publié: (2025) -
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
par: Fang, Chao, et autres
Publié: (2024)