Hermes: A Unified High-Performance NTT Architecture with Hybrid Dataflow
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Hang, Wang, Teng, Cheng, Qianyu, Li, Jinao, Zheng, Zhendong, Gong, Lei, Lou, Wenqi, Li, Xi, Zhou, Xuehai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
HF-NTT: Hazard-Free Dataflow Accelerator for Number Theoretic Transform
par: Meng, Xiangchen, et autres
Publié: (2024)
par: Meng, Xiangchen, et autres
Publié: (2024)
FlexMem: High-Parallel Near-Memory Architecture for Flexible Dataflow in Fully Homomorphic Encryption
par: Shi, Shangyi, et autres
Publié: (2025)
par: Shi, Shangyi, et autres
Publié: (2025)
High-Performance Pipelined NTT Accelerators with Homogeneous Digit-Serial Modulo Arithmetic
par: Alexakis, George, et autres
Publié: (2025)
par: Alexakis, George, et autres
Publié: (2025)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
par: Zheng, Jianing, et autres
Publié: (2025)
par: Zheng, Jianing, et autres
Publié: (2025)
DORA: Dataflow-Instruction Orchestration Architecture for DNN Acceleration
par: Chen, Xingzhen, et autres
Publié: (2026)
par: Chen, Xingzhen, et autres
Publié: (2026)
NEURAL: An Elastic Neuromorphic Architecture with Hybrid Data-Event Execution and On-the-fly Attention Dataflow
par: Chen, Yuehai, et autres
Publié: (2025)
par: Chen, Yuehai, et autres
Publié: (2025)
The Immutable Tensor Architecture: A Pure Dataflow Approach for Secure, Energy-Efficient AI Inference
par: Li, Fang
Publié: (2025)
par: Li, Fang
Publié: (2025)
@NTT: Algorithm-Targeted NTT hardware acceleration via Design-Time Constant Optimization
par: Nabeel, Mohammed, et autres
Publié: (2026)
par: Nabeel, Mohammed, et autres
Publié: (2026)
A High-Throughput FPGA Accelerator for Lightweight CNNs With Balanced Dataflow
par: Zhao, Zhiyuan, et autres
Publié: (2024)
par: Zhao, Zhiyuan, et autres
Publié: (2024)
Fast Cross-Operator Optimization of Attention Dataflow
par: Chang, Haodong, et autres
Publié: (2026)
par: Chang, Haodong, et autres
Publié: (2026)
DAS-MP: Enabling High-Quality Macro Placement with Enhanced Dataflow Awareness
par: Zhao, Xiaotian, et autres
Publié: (2025)
par: Zhao, Xiaotian, et autres
Publié: (2025)
Evaluation of Posits for Spectral Analysis Using a Software-Defined Dataflow Architecture
par: Deshmukh, Sameer, et autres
Publié: (2024)
par: Deshmukh, Sameer, et autres
Publié: (2024)
CODO: An Automated Compiler for Comprehensive Dataflow Optimization
par: Zhang, Weichuang, et autres
Publié: (2026)
par: Zhang, Weichuang, et autres
Publié: (2026)
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
par: Gao, Yizhao, et autres
Publié: (2024)
par: Gao, Yizhao, et autres
Publié: (2024)
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
par: Wang, Yimin, et autres
Publié: (2025)
par: Wang, Yimin, et autres
Publié: (2025)
ReDas: A Lightweight Architecture for Supporting Fine-Grained Reshaping and Multiple Dataflows on Systolic Array
par: Han, Meng, et autres
Publié: (2023)
par: Han, Meng, et autres
Publié: (2023)
A Dataflow Compiler for Efficient LLM Inference using Custom Microscaling Formats
par: Cheng, Jianyi, et autres
Publié: (2023)
par: Cheng, Jianyi, et autres
Publié: (2023)
PacQ: A SIMT Microarchitecture for Efficient Dataflow in Hyper-asymmetric GEMMs
par: Yin, Ruokai, et autres
Publié: (2025)
par: Yin, Ruokai, et autres
Publié: (2025)
PaReNTT: Low-Latency Parallel Residue Number System and NTT-Based Long Polynomial Modular Multiplication for Homomorphic Encryption
par: Tan, Weihang, et autres
Publié: (2023)
par: Tan, Weihang, et autres
Publié: (2023)
M100: An Orchestrated Dataflow Architecture Powering General AI Computing
par: Xie, Yan, et autres
Publié: (2026)
par: Xie, Yan, et autres
Publié: (2026)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
par: He, Siyuan, et autres
Publié: (2025)
par: He, Siyuan, et autres
Publié: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
par: Chang, Kaiyan, et autres
Publié: (2025)
par: Chang, Kaiyan, et autres
Publié: (2025)
Revet: A Language and Compiler for Dataflow Threads
par: Rucker, Alexander, et autres
Publié: (2023)
par: Rucker, Alexander, et autres
Publié: (2023)
Stream-HLS: Towards Automatic Dataflow Acceleration
par: Basalama, Suhail, et autres
Publié: (2025)
par: Basalama, Suhail, et autres
Publié: (2025)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
par: Yang, Kuilian, et autres
Publié: (2026)
par: Yang, Kuilian, et autres
Publié: (2026)
A Hierarchical Dataflow-Driven Heterogeneous Architecture for Wireless Baseband Processing
par: Jiang, Limin, et autres
Publié: (2024)
par: Jiang, Limin, et autres
Publié: (2024)
UFO-MAC: A Unified Framework for Optimization of High-Performance Multipliers and Multiply-Accumulators
par: Zuo, Dongsheng, et autres
Publié: (2024)
par: Zuo, Dongsheng, et autres
Publié: (2024)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
par: Ye, Hanchen, et autres
Publié: (2025)
par: Ye, Hanchen, et autres
Publié: (2025)
Implementing and Optimizing the Scaled Dot-Product Attention on Streaming Dataflow
par: Sohn, Gina, et autres
Publié: (2024)
par: Sohn, Gina, et autres
Publié: (2024)
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
par: Wang, Zhican, et autres
Publié: (2025)
par: Wang, Zhican, et autres
Publié: (2025)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
par: Gilbert, Michael, et autres
Publié: (2024)
par: Gilbert, Michael, et autres
Publié: (2024)
Fast Graph Vector Search via Hardware Acceleration and Delayed-Synchronization Traversal
par: Jiang, Wenqi, et autres
Publié: (2024)
par: Jiang, Wenqi, et autres
Publié: (2024)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
par: He, Xiaolin, et autres
Publié: (2025)
par: He, Xiaolin, et autres
Publié: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
par: Symons, Arne, et autres
Publié: (2022)
par: Symons, Arne, et autres
Publié: (2022)
DFModel: Design Space Optimization of Large-Scale Systems Exploiting Dataflow Mappings
par: Ko, Sho, et autres
Publié: (2024)
par: Ko, Sho, et autres
Publié: (2024)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
par: Qin, Shantian, et autres
Publié: (2025)
par: Qin, Shantian, et autres
Publié: (2025)
Documents similaires
-
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
par: Dong, Jiale, et autres
Publié: (2025) -
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025) -
HF-NTT: Hazard-Free Dataflow Accelerator for Number Theoretic Transform
par: Meng, Xiangchen, et autres
Publié: (2024) -
FlexMem: High-Parallel Near-Memory Architecture for Flexible Dataflow in Fully Homomorphic Encryption
par: Shi, Shangyi, et autres
Publié: (2025) -
High-Performance Pipelined NTT Accelerators with Homogeneous Digit-Serial Modulo Arithmetic
par: Alexakis, George, et autres
Publié: (2025)