Optimizing Tensor Train Decomposition in DNNs for RISC-V Architectures Using Design Space Exploration and Compiler Optimizations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Anthimopoulos, Theologos, Kokhazadeh, Milad, Kelefouras, Vasilios, Himpel, Benjamin, Keramidas, Georgios |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CIM-MLC: A Multi-level Compilation Stack for Computing-In-Memory Accelerators
par: Qu, Songyun, et autres
Publié: (2024)
par: Qu, Songyun, et autres
Publié: (2024)
A Compilation Framework for Quantum Circuits with Mid-Circuit Measurement Error Awareness
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
Optimization of 32-bit Unsigned Division by Constants on 64-bit Targets
par: Mitsunari, Shigeo, et autres
Publié: (2026)
par: Mitsunari, Shigeo, et autres
Publié: (2026)
Weight Block Sparsity: Training, Compilation, and AI Engine Accelerators
par: D'Alberto, Paolo, et autres
Publié: (2024)
par: D'Alberto, Paolo, et autres
Publié: (2024)
Ember: A Compiler for Efficient Embedding Operations on Decoupled Access-Execute Architectures
par: Siracusa, Marco, et autres
Publié: (2025)
par: Siracusa, Marco, et autres
Publié: (2025)
Kernel Looping: Eliminating Synchronization Boundaries for Peak Inference Performance
par: Koeplinger, David, et autres
Publié: (2024)
par: Koeplinger, David, et autres
Publié: (2024)
OpenEye: A Scalable Open-Source Hardware Accelerator for DNNs
par: Lebold, Denis, et autres
Publié: (2026)
par: Lebold, Denis, et autres
Publié: (2026)
HERMES: High-Performance RISC-V Memory Hierarchy for ML Workloads
par: Suryadevara, Pranav
Publié: (2025)
par: Suryadevara, Pranav
Publié: (2025)
Deep Recommender Models Inference: Automatic Asymmetric Data Flow Optimization
par: Ruggeri, Giuseppe, et autres
Publié: (2025)
par: Ruggeri, Giuseppe, et autres
Publié: (2025)
Vectorization of Verilog Designs and its Effects on Verification and Synthesis
par: Guimarães, Maria Fernanda Oliveira, et autres
Publié: (2026)
par: Guimarães, Maria Fernanda Oliveira, et autres
Publié: (2026)
Noncontact Multi-Point Vital Sign Monitoring with mmWave MIMO Radar
par: Ren, Wei, et autres
Publié: (2024)
par: Ren, Wei, et autres
Publié: (2024)
Inside VOLT: Designing an Open-Source GPU Compiler
par: Jeong, Shinnung, et autres
Publié: (2025)
par: Jeong, Shinnung, et autres
Publié: (2025)
AES-RV: Hardware-Efficient RISC-V Accelerator with Low-Latency AES Instruction Extension for IoT Security
par: Nguyen, Van Tinh, et autres
Publié: (2025)
par: Nguyen, Van Tinh, et autres
Publié: (2025)
RowHammer Vulnerability Counter (RVC): Redefining RowHammer Detection with Victim-Centric Tracking
par: Jain, Lavi, et autres
Publié: (2026)
par: Jain, Lavi, et autres
Publié: (2026)
FPGA-Accelerated Lock Management and Transaction Processing: Architecture, Optimization, and Design Space Exploration
par: Zhu, Shien, et autres
Publié: (2026)
par: Zhu, Shien, et autres
Publié: (2026)
CLIPGen: A Chiplet Link IP Modeling and Generation Framework for 2.5D Architecture Exploration
par: Zhu, Zhengping, et autres
Publié: (2026)
par: Zhu, Zhengping, et autres
Publié: (2026)
FREESS: An Educational Simulator of a RISC-V-Inspired Superscalar Processor Based on Tomasulo's Algorithm
par: Giorgi, Roberto
Publié: (2025)
par: Giorgi, Roberto
Publié: (2025)
Pandora's Box in Your SSD: The Untold Dangers of NVMe
par: Wertenbroek, Rick, et autres
Publié: (2024)
par: Wertenbroek, Rick, et autres
Publié: (2024)
Bottom-Up Generation of Verilog Designs for Testing EDA Tools
par: Vieira, João Victor Amorim, et autres
Publié: (2025)
par: Vieira, João Victor Amorim, et autres
Publié: (2025)
MEDEA: A Design-Time Multi-Objective Manager for Energy-Efficient DNN Inference on Heterogeneous Ultra-Low Power Platforms
par: Taji, Hossein, et autres
Publié: (2025)
par: Taji, Hossein, et autres
Publié: (2025)
AXI4MLIR: User-Driven Automatic Host Code Generation for Custom AXI-Based Accelerators
par: Agostini, Nicolas Bohm, et autres
Publié: (2023)
par: Agostini, Nicolas Bohm, et autres
Publié: (2023)
A Scalable Architecture for Efficient Multi-bit Fully Homomorphic Encryption
par: Ma, Jiaao, et autres
Publié: (2025)
par: Ma, Jiaao, et autres
Publié: (2025)
SynapticCore-X: A Modular Neural Processing Architecture for Low-Cost FPGA Acceleration
par: Parameshwara, Arya
Publié: (2025)
par: Parameshwara, Arya
Publié: (2025)
FPGA-Accelerated RISC-V ISA Extensions for Efficient Neural Network Inference on Edge Devices
par: Parameshwara, Arya, et autres
Publié: (2025)
par: Parameshwara, Arya, et autres
Publié: (2025)
Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors
par: Abraham, Ojima, et autres
Publié: (2026)
par: Abraham, Ojima, et autres
Publié: (2026)
Fast and Practical Strassen's Matrix Multiplication using FPGAs
par: Ahmad, Afzal, et autres
Publié: (2024)
par: Ahmad, Afzal, et autres
Publié: (2024)
Veryl: A New Hardware Description Language as an Altarnative to SystemVerilog
par: Hatta, Naoya, et autres
Publié: (2024)
par: Hatta, Naoya, et autres
Publié: (2024)
Sequence-Based Incremental Concolic Testing of RTL Models
par: Witharana, Hasini, et autres
Publié: (2023)
par: Witharana, Hasini, et autres
Publié: (2023)
Non-interfering On-line and In-field SoC Testing
par: Strauch, Tobias
Publié: (2024)
par: Strauch, Tobias
Publié: (2024)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
par: Liu, Lian, et autres
Publié: (2025)
par: Liu, Lian, et autres
Publié: (2025)
Enabling full-speed random access to the entire memory on the A100 GPU
par: Walker, Alden
Publié: (2024)
par: Walker, Alden
Publié: (2024)
Hardware-Aware Neural Network Compilation with Learned Optimization: A RISC-V Accelerator Approach
par: Ganti, Ravindra, et autres
Publié: (2025)
par: Ganti, Ravindra, et autres
Publié: (2025)
ALL-MASK: A Reconfigurable Logic Locking Method for Multicore Architecture with Sequential-Instruction-Oriented Key
par: Wang, Jianfeng, et autres
Publié: (2022)
par: Wang, Jianfeng, et autres
Publié: (2022)
RISCBench: Benchmarking RISC-V Orchestration Efficiency in FPGA and FPGA-Like Computing Engines
par: Ojika, Dave, et autres
Publié: (2025)
par: Ojika, Dave, et autres
Publié: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
par: Symons, Arne, et autres
Publié: (2022)
par: Symons, Arne, et autres
Publié: (2022)
Architectural Isolation as a Timing Safety Primitive for Edge AI Medical Devices: Controlled Experimental Evidence on a Shared-Silicon Platform
par: Swami, Akul Mallayya
Publié: (2026)
par: Swami, Akul Mallayya
Publié: (2026)
A Customized Memory-aware Architecture for Biological Sequence Alignment
par: Akbari, Nasrin, et autres
Publié: (2025)
par: Akbari, Nasrin, et autres
Publié: (2025)
Megakernel vs Wavefront GPU Path Tracing
par: Padilla, Rafael, et autres
Publié: (2026)
par: Padilla, Rafael, et autres
Publié: (2026)
FPGA-based Acceleration for Convolutional Neural Networks: A Comprehensive Review
par: Jiang, Junye, et autres
Publié: (2025)
par: Jiang, Junye, et autres
Publié: (2025)
A Parameterizable Convolution Accelerator for Embedded Deep Learning Applications
par: Mousouliotis, Panagiotis, et autres
Publié: (2026)
par: Mousouliotis, Panagiotis, et autres
Publié: (2026)
Documents similaires
-
CIM-MLC: A Multi-level Compilation Stack for Computing-In-Memory Accelerators
par: Qu, Songyun, et autres
Publié: (2024) -
A Compilation Framework for Quantum Circuits with Mid-Circuit Measurement Error Awareness
par: Zhong, Ming, et autres
Publié: (2025) -
Optimization of 32-bit Unsigned Division by Constants on 64-bit Targets
par: Mitsunari, Shigeo, et autres
Publié: (2026) -
Weight Block Sparsity: Training, Compilation, and AI Engine Accelerators
par: D'Alberto, Paolo, et autres
Publié: (2024) -
Ember: A Compiler for Efficient Embedding Operations on Decoupled Access-Execute Architectures
par: Siracusa, Marco, et autres
Publié: (2025)