TriADA: Massively Parallel Trilinear Matrix-by-Tensor Multiply-Add Algorithm and Device Architecture for the Acceleration of 3D Discrete Transformations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sedukhin, Stanislav, Tomioka, Yoichi, Matsumoto, Kazuya, Okuyama, Yuichi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlexiBit: Fully Flexible Precision Bit-parallel Accelerator Architecture for Arbitrary Mixed Precision AI
par: Tahmasebi, Faraz, et autres
Publié: (2024)
par: Tahmasebi, Faraz, et autres
Publié: (2024)
Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors
par: Abraham, Ojima, et autres
Publié: (2026)
par: Abraham, Ojima, et autres
Publié: (2026)
Optimizing Tensor Train Decomposition in DNNs for RISC-V Architectures Using Design Space Exploration and Compiler Optimizations
par: Anthimopoulos, Theologos, et autres
Publié: (2026)
par: Anthimopoulos, Theologos, et autres
Publié: (2026)
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
par: Ma, Cong, et autres
Publié: (2025)
par: Ma, Cong, et autres
Publié: (2025)
HYLU: Hybrid Parallel Sparse LU Factorization
par: Chen, Xiaoming
Publié: (2025)
par: Chen, Xiaoming
Publié: (2025)
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
par: Mo, Zhiwen, et autres
Publié: (2024)
par: Mo, Zhiwen, et autres
Publié: (2024)
A Compilation Framework for Quantum Circuits with Mid-Circuit Measurement Error Awareness
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
A Per-Access Upper Bound for Shared-Resource Interference in Direct-Mapped Multicore Architectures
par: Pedroni, Felipe T.
Publié: (2026)
par: Pedroni, Felipe T.
Publié: (2026)
Ember: A Compiler for Efficient Embedding Operations on Decoupled Access-Execute Architectures
par: Siracusa, Marco, et autres
Publié: (2025)
par: Siracusa, Marco, et autres
Publié: (2025)
Ten-Four: An Open-Source Fused Dot Product Unit for Mixed-Precision GPGPU Tensor Cores
par: Rout, Nikhil, et autres
Publié: (2025)
par: Rout, Nikhil, et autres
Publié: (2025)
TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference
par: Li, Zhuoran, et autres
Publié: (2026)
par: Li, Zhuoran, et autres
Publié: (2026)
RowHammer Vulnerability Counter (RVC): Redefining RowHammer Detection with Victim-Centric Tracking
par: Jain, Lavi, et autres
Publié: (2026)
par: Jain, Lavi, et autres
Publié: (2026)
The Monte Carlo Method and New Device and Architectural Techniques for Accelerating It
par: Petangoda, Janith, et autres
Publié: (2025)
par: Petangoda, Janith, et autres
Publié: (2025)
Exploring the Design Space for Message-Driven Systems for Dynamic Graph Processing using CCA
par: Chandio, Bibrak Qamar, et autres
Publié: (2024)
par: Chandio, Bibrak Qamar, et autres
Publié: (2024)
Kernel Looping: Eliminating Synchronization Boundaries for Peak Inference Performance
par: Koeplinger, David, et autres
Publié: (2024)
par: Koeplinger, David, et autres
Publié: (2024)
Covariance Matrix Analysis for Optimal Portfolio Selection
par: Keith, Lim Hao Shen
Publié: (2024)
par: Keith, Lim Hao Shen
Publié: (2024)
Fast and Practical Strassen's Matrix Multiplication using FPGAs
par: Ahmad, Afzal, et autres
Publié: (2024)
par: Ahmad, Afzal, et autres
Publié: (2024)
An SMT Formalization of Mixed-Precision Matrix Multiplication: Modeling Three Generations of Tensor Cores
par: Valpey, Benjamin, et autres
Publié: (2025)
par: Valpey, Benjamin, et autres
Publié: (2025)
Assembly of FETI dual operator using CUDA
par: Homola, Jakub, et autres
Publié: (2025)
par: Homola, Jakub, et autres
Publié: (2025)
pLUTo: Enabling Massively Parallel Computation in DRAM via Lookup Tables
par: Ferreira, João Dinis, et autres
Publié: (2021)
par: Ferreira, João Dinis, et autres
Publié: (2021)
Speed, power and cost implications for GPU acceleration of Computational Fluid Dynamics on HPC systems
par: Cooper-Baldock, Zachary, et autres
Publié: (2024)
par: Cooper-Baldock, Zachary, et autres
Publié: (2024)
Factor Machine: Mixed-signal Architecture for Fine-Grained Graph-Based Computing
par: Dudek, Piotr
Publié: (2024)
par: Dudek, Piotr
Publié: (2024)
Multi-level informed optimization via decomposed Kriging for large design problems under uncertainty
par: Ampellio, Enrico, et autres
Publié: (2025)
par: Ampellio, Enrico, et autres
Publié: (2025)
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
par: Chillarón, Mónica, et autres
Publié: (2024)
par: Chillarón, Mónica, et autres
Publié: (2024)
Efficient Parallel Scheduling for Sparse Triangular Solvers
par: Böhnlein, Toni, et autres
Publié: (2025)
par: Böhnlein, Toni, et autres
Publié: (2025)
Scalable s-step Preconditioned Conjugate Gradient with Chebyshev Basis and Gauss-Seidel Gram Solve
par: D'Ambra, Pasqua, et autres
Publié: (2026)
par: D'Ambra, Pasqua, et autres
Publié: (2026)
Tensor Decompositions for Count Data that Leverage Stochastic and Deterministic Optimization
par: Myers, Jeremy M., et autres
Publié: (2022)
par: Myers, Jeremy M., et autres
Publié: (2022)
A Comparative Analysis of ARM and x86-64 Laptop-Class Processors: Architecture, Assembly-Level Performance, and Energy Efficiency
par: Özyılmaz, Mustafa Mert
Publié: (2026)
par: Özyılmaz, Mustafa Mert
Publié: (2026)
MEDEA: A Design-Time Multi-Objective Manager for Energy-Efficient DNN Inference on Heterogeneous Ultra-Low Power Platforms
par: Taji, Hossein, et autres
Publié: (2025)
par: Taji, Hossein, et autres
Publié: (2025)
Local Adjoints for Simultaneous Preaccumulations with Shared Inputs
par: Blühdorn, Johannes, et autres
Publié: (2024)
par: Blühdorn, Johannes, et autres
Publié: (2024)
Hybrid parallel discrete adjoints in SU2
par: Blühdorn, Johannes, et autres
Publié: (2024)
par: Blühdorn, Johannes, et autres
Publié: (2024)
Flexible Quaternion Generalized Minimal Residual Method for Ill-Posed Quaternion Inverse Problems
par: Liu, Xuan, et autres
Publié: (2024)
par: Liu, Xuan, et autres
Publié: (2024)
SynapticCore-X: A Modular Neural Processing Architecture for Low-Cost FPGA Acceleration
par: Parameshwara, Arya
Publié: (2025)
par: Parameshwara, Arya
Publié: (2025)
RV-IM100: Quantifying ISA Extension, Datapath Width, and Pipeline Depth Trade-offs in RISC-V Microarchitectures
par: Kang, Hyunwoo
Publié: (2026)
par: Kang, Hyunwoo
Publié: (2026)
Dataflow & Tiling Strategies in Edge-AI FPGA Accelerators: A Comprehensive Literature Review
par: Li, Richie
Publié: (2025)
par: Li, Richie
Publié: (2025)
ArchAgent: Agentic AI-driven Computer Architecture Discovery
par: Gupta, Raghav, et autres
Publié: (2026)
par: Gupta, Raghav, et autres
Publié: (2026)
Random Alloy Codes and the Fundamental Limits of Coded Distributed Tensors
par: Soto, Pedro
Publié: (2022)
par: Soto, Pedro
Publié: (2022)
The pitfalls of verifying floating-point computations
par: Monniaux, David
Publié: (2007)
par: Monniaux, David
Publié: (2007)
FREESS: An Educational Simulator of a RISC-V-Inspired Superscalar Processor Based on Tomasulo's Algorithm
par: Giorgi, Roberto
Publié: (2025)
par: Giorgi, Roberto
Publié: (2025)
Hardware Trends Impacting Floating-Point Computations In Scientific Applications
par: Dongarra, Jack, et autres
Publié: (2024)
par: Dongarra, Jack, et autres
Publié: (2024)
Documents similaires
-
FlexiBit: Fully Flexible Precision Bit-parallel Accelerator Architecture for Arbitrary Mixed Precision AI
par: Tahmasebi, Faraz, et autres
Publié: (2024) -
Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors
par: Abraham, Ojima, et autres
Publié: (2026) -
Optimizing Tensor Train Decomposition in DNNs for RISC-V Architectures Using Design Space Exploration and Compiler Optimizations
par: Anthimopoulos, Theologos, et autres
Publié: (2026) -
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
par: Ma, Cong, et autres
Publié: (2025) -
HYLU: Hybrid Parallel Sparse LU Factorization
par: Chen, Xiaoming
Publié: (2025)