PIFS-Rec: Process-In-Fabric-Switch for Large-Scale Recommendation System Inferences
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huo, Pingyi, Devulapally, Anusha, Maruf, Hasan Al, Park, Minseo, Nair, Krishnakumar, Arunachalam, Meena, Akbulut, Gulsum Gudukbay, Kandemir, Mahmut Taylan, Narayanan, Vijaykrishnan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
Synergistic and Efficient Edge-Host Communication for Energy Harvesting Wireless Sensor Networks
par: Mishra, Cyan Subhra, et autres
Publié: (2024)
par: Mishra, Cyan Subhra, et autres
Publié: (2024)
Salient Store: Enabling Smart Storage for Continuous Learning Edge Servers
par: Mishra, Cyan Subhra, et autres
Publié: (2024)
par: Mishra, Cyan Subhra, et autres
Publié: (2024)
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
par: Kang, Seungkwan, et autres
Publié: (2026)
par: Kang, Seungkwan, et autres
Publié: (2026)
ACiS: Complex Processing in the Switch Fabric
par: Haghi, Pouya, et autres
Publié: (2025)
par: Haghi, Pouya, et autres
Publié: (2025)
RecFlash: Fast Recommendation System on In-Storage Computing with Frequency-Based Data Mapping
par: Baik, Jangho, et autres
Publié: (2026)
par: Baik, Jangho, et autres
Publié: (2026)
Pushing the Performance Envelope of DNN-based Recommendation Systems Inference on GPUs
par: Jain, Rishabh, et autres
Publié: (2024)
par: Jain, Rishabh, et autres
Publié: (2024)
STAMP-2.5D: Structural and Thermal Aware Methodology for Placement in 2.5D Integration
par: Parekh, Varun Darshana, et autres
Publié: (2025)
par: Parekh, Varun Darshana, et autres
Publié: (2025)
Containerized In-Storage Processing and Computing-Enabled SSD Disaggregation
par: Kwon, Miryeong, et autres
Publié: (2025)
par: Kwon, Miryeong, et autres
Publié: (2025)
Single-Cell Universal Logic-in-Memory Using 2T-nC FeRAM: An Area and Energy-Efficient Approach for Bulk Bitwise Computation
par: Biswas, Rudra, et autres
Publié: (2025)
par: Biswas, Rudra, et autres
Publié: (2025)
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
par: Topcu, Burak, et autres
Publié: (2026)
par: Topcu, Burak, et autres
Publié: (2026)
Pretraining large language models with MXFP4 on Native FP4 Hardware
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
Heterogeneous Acceleration Pipeline for Recommendation System Training
par: Adnan, Muhammad, et autres
Publié: (2022)
par: Adnan, Muhammad, et autres
Publié: (2022)
Fletch: File-System Metadata Caching in Programmable Switches
par: Liu, Qingxiu, et autres
Publié: (2025)
par: Liu, Qingxiu, et autres
Publié: (2025)
Ultra Low-Power SDM-based Circuit-Switching for Networks-on-Chip
par: Zaeemi, Meysam, et autres
Publié: (2026)
par: Zaeemi, Meysam, et autres
Publié: (2026)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
par: Jiang, Aojie, et autres
Publié: (2026)
par: Jiang, Aojie, et autres
Publié: (2026)
In-place Switch: Reprogramming based SLC Cache Design for Hybrid 3D SSDs
par: Yang, Xufeng, et autres
Publié: (2024)
par: Yang, Xufeng, et autres
Publié: (2024)
FEATHER: A Reconfigurable Accelerator with Data Reordering Support for Low-Cost On-Chip Dataflow Switching
par: Tong, Jianming, et autres
Publié: (2024)
par: Tong, Jianming, et autres
Publié: (2024)
Switch-Less Dragonfly on Wafers: A Scalable Interconnection Architecture based on Wafer-Scale Integration
par: Feng, Yinxiao, et autres
Publié: (2024)
par: Feng, Yinxiao, et autres
Publié: (2024)
The Dirty Secret of SSDs: Embodied Carbon
par: Tannu, Swamit, et autres
Publié: (2022)
par: Tannu, Swamit, et autres
Publié: (2022)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
Design of a 6-bit Threshold Inverter Quantization (TIQ) Flash Analog to Digital Converter (ADC)
par: Sarkar, Noyon Kumar, et autres
Publié: (2025)
par: Sarkar, Noyon Kumar, et autres
Publié: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Commercial Evaluation of Zero-Skipping MAC Design for Bit Sparsity Exploitation in DL Inference
par: Nair, Harideep, et autres
Publié: (2024)
par: Nair, Harideep, et autres
Publié: (2024)
Lyra: A Hardware-Accelerated RISC-V Verification Framework with Generative Model-Based Processor Fuzzing
par: Huo, Juncheng, et autres
Publié: (2025)
par: Huo, Juncheng, et autres
Publié: (2025)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
par: Xuan, Zihao, et autres
Publié: (2026)
par: Xuan, Zihao, et autres
Publié: (2026)
NeuroAI Temporal Neural Networks (NeuTNNs): Microarchitecture and Design Framework for Specialized Neuromorphic Processing Units
par: Venkatachalam, Shanmuga, et autres
Publié: (2026)
par: Venkatachalam, Shanmuga, et autres
Publié: (2026)
Evaluating LLM-based Workflows for Switched-Mode Power Supply Design
par: Nau, Simon, et autres
Publié: (2025)
par: Nau, Simon, et autres
Publié: (2025)
Switching Frequency as FPGA Monitor: Studying Degradation and Ageing Prognosis at Large Scale
par: Lanzieri, Leandro, et autres
Publié: (2024)
par: Lanzieri, Leandro, et autres
Publié: (2024)
tubGEMM: Energy-Efficient and Sparsity-Effective Temporal-Unary-Binary Based Matrix Multiply Unit
par: Vellaisamy, Prabhu, et autres
Publié: (2024)
par: Vellaisamy, Prabhu, et autres
Publié: (2024)
SCARF: Securing Chips with a Robust Framework against Fabrication-time Hardware Trojans
par: Eslami, Mohammad, et autres
Publié: (2024)
par: Eslami, Mohammad, et autres
Publié: (2024)
Faithful Dynamic Timing Analysis of Digital Circuits Using Continuous Thresholded Mode-Switched ODEs
par: Ferdowsi, Arman, et autres
Publié: (2024)
par: Ferdowsi, Arman, et autres
Publié: (2024)
ALL-MASK: A Reconfigurable Logic Locking Method for Multicore Architecture with Sequential-Instruction-Oriented Key
par: Wang, Jianfeng, et autres
Publié: (2022)
par: Wang, Jianfeng, et autres
Publié: (2022)
NeRTCAM: CAM-Based CMOS Implementation of Reference Frames for Neuromorphic Processors
par: Nair, Harideep, et autres
Publié: (2024)
par: Nair, Harideep, et autres
Publié: (2024)
Exploration of Unary Arithmetic-Based Matrix Multiply Units for Low Precision DL Accelerators
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
CiFlow: Dataflow Analysis and Optimization of Key Switching for Homomorphic Encryption
par: Neda, Negar, et autres
Publié: (2023)
par: Neda, Negar, et autres
Publié: (2023)
SPAC: Automating FPGA-based Network Switches with Protocol Adaptive Customization
par: Li, Guoyu, et autres
Publié: (2026)
par: Li, Guoyu, et autres
Publié: (2026)
Sectored DRAM: A Practical Energy-Efficient and High-Performance Fine-Grained DRAM Architecture
par: Olgun, Ataberk, et autres
Publié: (2022)
par: Olgun, Ataberk, et autres
Publié: (2022)
ProactivePIM: Accelerating Weight-Sharing Embedding Layer with PIM for Scalable Recommendation System
par: Kim, Youngsuk, et autres
Publié: (2024)
par: Kim, Youngsuk, et autres
Publié: (2024)
Documents similaires
-
Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4
par: Cim, Musa, et autres
Publié: (2026) -
Synergistic and Efficient Edge-Host Communication for Energy Harvesting Wireless Sensor Networks
par: Mishra, Cyan Subhra, et autres
Publié: (2024) -
Salient Store: Enabling Smart Storage for Continuous Learning Edge Servers
par: Mishra, Cyan Subhra, et autres
Publié: (2024) -
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
par: Kang, Seungkwan, et autres
Publié: (2026) -
ACiS: Complex Processing in the Switch Fabric
par: Haghi, Pouya, et autres
Publié: (2025)