INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order Gradient Computations in Implicit Neural Representation Processing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Abi-Karam, Stefan, Sarkar, Rishov, Xu, Dejia, Fan, Zhiwen, Wang, Zhangyang, Hao, Cong |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Kitsune: Enabling Dataflow Execution on GPUs
par: Davies, Michael, et autres
Publié: (2025)
par: Davies, Michael, et autres
Publié: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
par: Negi, Shubham, et autres
Publié: (2025)
par: Negi, Shubham, et autres
Publié: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
par: Shi, Man, et autres
Publié: (2024)
par: Shi, Man, et autres
Publié: (2024)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
par: Szafarczyk, Robert, et autres
Publié: (2025)
par: Szafarczyk, Robert, et autres
Publié: (2025)
New Tools, Programming Models, and System Support for Processing-in-Memory Architectures
par: Oliveira, Geraldo F.
Publié: (2025)
par: Oliveira, Geraldo F.
Publié: (2025)
Proteus: Enabling High-Performance Processing-Using-DRAM with Dynamic Bit-Precision, Adaptive Data Representation, and Flexible Arithmetic
par: Oliveira, Geraldo F., et autres
Publié: (2025)
par: Oliveira, Geraldo F., et autres
Publié: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
par: Yang, Peiming, et autres
Publié: (2025)
par: Yang, Peiming, et autres
Publié: (2025)
General-Purpose Multicore Architectures
par: Ghose, Saugata
Publié: (2024)
par: Ghose, Saugata
Publié: (2024)
Dynamic Simultaneous Multithreaded Architecture
par: Ortiz-Arroyo, Daniel, et autres
Publié: (2024)
par: Ortiz-Arroyo, Daniel, et autres
Publié: (2024)
SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
par: Li, Jonathan, et autres
Publié: (2025)
par: Li, Jonathan, et autres
Publié: (2025)
PIUMA: Programmable Integrated Unified Memory Architecture
par: Aananthakrishnan, Sriram, et autres
Publié: (2020)
par: Aananthakrishnan, Sriram, et autres
Publié: (2020)
Efficient Architecture for RISC-V Vector Memory Access
par: Guan, Hongyi, et autres
Publié: (2025)
par: Guan, Hongyi, et autres
Publié: (2025)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
Navigating the Landscape of Distributed File Systems: Architectures, Implementations, and Considerations
par: Pan, Xueting, et autres
Publié: (2024)
par: Pan, Xueting, et autres
Publié: (2024)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
How Fast Can Graph Computations Go on Fine-grained Parallel Architectures
par: Wang, Yuqing, et autres
Publié: (2025)
par: Wang, Yuqing, et autres
Publié: (2025)
A Modern Primer on Processing in Memory
par: Mutlu, Onur, et autres
Publié: (2020)
par: Mutlu, Onur, et autres
Publié: (2020)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
ALPHA-PIM: Analysis of Linear Algebraic Processing for High-Performance Graph Applications on a Real Processing-In-Memory System
par: Barkhordar, Marzieh, et autres
Publié: (2026)
par: Barkhordar, Marzieh, et autres
Publié: (2026)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
par: Zou, An, et autres
Publié: (2025)
par: Zou, An, et autres
Publié: (2025)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
par: Prakriya, Neha, et autres
Publié: (2023)
par: Prakriya, Neha, et autres
Publié: (2023)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025)
par: Asquini, Lorenzo, et autres
Publié: (2025)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
Memory-Centric Computing: Recent Advances in Processing-in-DRAM
par: Mutlu, Onur, et autres
Publié: (2024)
par: Mutlu, Onur, et autres
Publié: (2024)
Atomique: A Quantum Compiler for Reconfigurable Neutral Atom Arrays
par: Wang, Hanrui, et autres
Publié: (2023)
par: Wang, Hanrui, et autres
Publié: (2023)
MIMDRAM: An End-to-End Processing-Using-DRAM System for High-Throughput, Energy-Efficient and Programmer-Transparent Multiple-Instruction Multiple-Data Processing
par: Oliveira, Geraldo F., et autres
Publié: (2024)
par: Oliveira, Geraldo F., et autres
Publié: (2024)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025)
par: Kong, Fanchen, et autres
Publié: (2025)
Topology-Aware Virtualization over Inter-Core Connected Neural Processing Units
par: Feng, Dahu, et autres
Publié: (2025)
par: Feng, Dahu, et autres
Publié: (2025)
PUDTune: Multi-Level Charging for High-Precision Calibration in Processing-Using-DRAM
par: Kubo, Tatsuya, et autres
Publié: (2025)
par: Kubo, Tatsuya, et autres
Publié: (2025)
NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2026)
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2026)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
par: Mo, Zhiwen, et autres
Publié: (2026)
par: Mo, Zhiwen, et autres
Publié: (2026)
ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
par: Yeo, Gwangoo, et autres
Publié: (2026)
par: Yeo, Gwangoo, et autres
Publié: (2026)
PID-Comm: A Fast and Flexible Collective Communication Framework for Commodity Processing-in-DIMM Devices
par: Noh, Si Ung, et autres
Publié: (2024)
par: Noh, Si Ung, et autres
Publié: (2024)
Documents similaires
-
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020) -
Kitsune: Enabling Dataflow Execution on GPUs
par: Davies, Michael, et autres
Publié: (2025) -
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
par: Negi, Shubham, et autres
Publié: (2025) -
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
par: Shi, Man, et autres
Publié: (2024) -
Compiler Support for Speculation in Decoupled Access/Execute Architectures
par: Szafarczyk, Robert, et autres
Publié: (2025)