PIFS-Rec: Process-In-Fabric-Switch for Large-Scale Recommendation System Inferences
Fuente:
arXiv
Salvato in:
| Autori principali: | Huo, Pingyi, Devulapally, Anusha, Maruf, Hasan Al, Park, Minseo, Nair, Krishnakumar, Arunachalam, Meena, Akbulut, Gulsum Gudukbay, Kandemir, Mahmut Taylan, Narayanan, Vijaykrishnan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4
di: Cim, Musa, et al.
Pubblicazione: (2026)
di: Cim, Musa, et al.
Pubblicazione: (2026)
Synergistic and Efficient Edge-Host Communication for Energy Harvesting Wireless Sensor Networks
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024)
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024)
Salient Store: Enabling Smart Storage for Continuous Learning Edge Servers
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024)
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024)
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
di: Kang, Seungkwan, et al.
Pubblicazione: (2026)
di: Kang, Seungkwan, et al.
Pubblicazione: (2026)
ACiS: Complex Processing in the Switch Fabric
di: Haghi, Pouya, et al.
Pubblicazione: (2025)
di: Haghi, Pouya, et al.
Pubblicazione: (2025)
RecFlash: Fast Recommendation System on In-Storage Computing with Frequency-Based Data Mapping
di: Baik, Jangho, et al.
Pubblicazione: (2026)
di: Baik, Jangho, et al.
Pubblicazione: (2026)
Pushing the Performance Envelope of DNN-based Recommendation Systems Inference on GPUs
di: Jain, Rishabh, et al.
Pubblicazione: (2024)
di: Jain, Rishabh, et al.
Pubblicazione: (2024)
STAMP-2.5D: Structural and Thermal Aware Methodology for Placement in 2.5D Integration
di: Parekh, Varun Darshana, et al.
Pubblicazione: (2025)
di: Parekh, Varun Darshana, et al.
Pubblicazione: (2025)
Containerized In-Storage Processing and Computing-Enabled SSD Disaggregation
di: Kwon, Miryeong, et al.
Pubblicazione: (2025)
di: Kwon, Miryeong, et al.
Pubblicazione: (2025)
Single-Cell Universal Logic-in-Memory Using 2T-nC FeRAM: An Area and Energy-Efficient Approach for Bulk Bitwise Computation
di: Biswas, Rudra, et al.
Pubblicazione: (2025)
di: Biswas, Rudra, et al.
Pubblicazione: (2025)
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
di: Topcu, Burak, et al.
Pubblicazione: (2026)
di: Topcu, Burak, et al.
Pubblicazione: (2026)
Pretraining large language models with MXFP4 on Native FP4 Hardware
di: Cim, Musa, et al.
Pubblicazione: (2026)
di: Cim, Musa, et al.
Pubblicazione: (2026)
Heterogeneous Acceleration Pipeline for Recommendation System Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
Fletch: File-System Metadata Caching in Programmable Switches
di: Liu, Qingxiu, et al.
Pubblicazione: (2025)
di: Liu, Qingxiu, et al.
Pubblicazione: (2025)
Ultra Low-Power SDM-based Circuit-Switching for Networks-on-Chip
di: Zaeemi, Meysam, et al.
Pubblicazione: (2026)
di: Zaeemi, Meysam, et al.
Pubblicazione: (2026)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
In-place Switch: Reprogramming based SLC Cache Design for Hybrid 3D SSDs
di: Yang, Xufeng, et al.
Pubblicazione: (2024)
di: Yang, Xufeng, et al.
Pubblicazione: (2024)
FEATHER: A Reconfigurable Accelerator with Data Reordering Support for Low-Cost On-Chip Dataflow Switching
di: Tong, Jianming, et al.
Pubblicazione: (2024)
di: Tong, Jianming, et al.
Pubblicazione: (2024)
Switch-Less Dragonfly on Wafers: A Scalable Interconnection Architecture based on Wafer-Scale Integration
di: Feng, Yinxiao, et al.
Pubblicazione: (2024)
di: Feng, Yinxiao, et al.
Pubblicazione: (2024)
The Dirty Secret of SSDs: Embodied Carbon
di: Tannu, Swamit, et al.
Pubblicazione: (2022)
di: Tannu, Swamit, et al.
Pubblicazione: (2022)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
di: Cheng, Feng, et al.
Pubblicazione: (2025)
di: Cheng, Feng, et al.
Pubblicazione: (2025)
Design of a 6-bit Threshold Inverter Quantization (TIQ) Flash Analog to Digital Converter (ADC)
di: Sarkar, Noyon Kumar, et al.
Pubblicazione: (2025)
di: Sarkar, Noyon Kumar, et al.
Pubblicazione: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
di: Zhang, Chi, et al.
Pubblicazione: (2026)
di: Zhang, Chi, et al.
Pubblicazione: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Commercial Evaluation of Zero-Skipping MAC Design for Bit Sparsity Exploitation in DL Inference
di: Nair, Harideep, et al.
Pubblicazione: (2024)
di: Nair, Harideep, et al.
Pubblicazione: (2024)
Lyra: A Hardware-Accelerated RISC-V Verification Framework with Generative Model-Based Processor Fuzzing
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
NeuroAI Temporal Neural Networks (NeuTNNs): Microarchitecture and Design Framework for Specialized Neuromorphic Processing Units
di: Venkatachalam, Shanmuga, et al.
Pubblicazione: (2026)
di: Venkatachalam, Shanmuga, et al.
Pubblicazione: (2026)
Evaluating LLM-based Workflows for Switched-Mode Power Supply Design
di: Nau, Simon, et al.
Pubblicazione: (2025)
di: Nau, Simon, et al.
Pubblicazione: (2025)
Switching Frequency as FPGA Monitor: Studying Degradation and Ageing Prognosis at Large Scale
di: Lanzieri, Leandro, et al.
Pubblicazione: (2024)
di: Lanzieri, Leandro, et al.
Pubblicazione: (2024)
tubGEMM: Energy-Efficient and Sparsity-Effective Temporal-Unary-Binary Based Matrix Multiply Unit
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2024)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2024)
SCARF: Securing Chips with a Robust Framework against Fabrication-time Hardware Trojans
di: Eslami, Mohammad, et al.
Pubblicazione: (2024)
di: Eslami, Mohammad, et al.
Pubblicazione: (2024)
Faithful Dynamic Timing Analysis of Digital Circuits Using Continuous Thresholded Mode-Switched ODEs
di: Ferdowsi, Arman, et al.
Pubblicazione: (2024)
di: Ferdowsi, Arman, et al.
Pubblicazione: (2024)
ALL-MASK: A Reconfigurable Logic Locking Method for Multicore Architecture with Sequential-Instruction-Oriented Key
di: Wang, Jianfeng, et al.
Pubblicazione: (2022)
di: Wang, Jianfeng, et al.
Pubblicazione: (2022)
NeRTCAM: CAM-Based CMOS Implementation of Reference Frames for Neuromorphic Processors
di: Nair, Harideep, et al.
Pubblicazione: (2024)
di: Nair, Harideep, et al.
Pubblicazione: (2024)
Exploration of Unary Arithmetic-Based Matrix Multiply Units for Low Precision DL Accelerators
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2026)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2026)
CiFlow: Dataflow Analysis and Optimization of Key Switching for Homomorphic Encryption
di: Neda, Negar, et al.
Pubblicazione: (2023)
di: Neda, Negar, et al.
Pubblicazione: (2023)
SPAC: Automating FPGA-based Network Switches with Protocol Adaptive Customization
di: Li, Guoyu, et al.
Pubblicazione: (2026)
di: Li, Guoyu, et al.
Pubblicazione: (2026)
Sectored DRAM: A Practical Energy-Efficient and High-Performance Fine-Grained DRAM Architecture
di: Olgun, Ataberk, et al.
Pubblicazione: (2022)
di: Olgun, Ataberk, et al.
Pubblicazione: (2022)
ProactivePIM: Accelerating Weight-Sharing Embedding Layer with PIM for Scalable Recommendation System
di: Kim, Youngsuk, et al.
Pubblicazione: (2024)
di: Kim, Youngsuk, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4
di: Cim, Musa, et al.
Pubblicazione: (2026) -
Synergistic and Efficient Edge-Host Communication for Energy Harvesting Wireless Sensor Networks
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024) -
Salient Store: Enabling Smart Storage for Continuous Learning Edge Servers
di: Mishra, Cyan Subhra, et al.
Pubblicazione: (2024) -
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
di: Kang, Seungkwan, et al.
Pubblicazione: (2026) -
ACiS: Complex Processing in the Switch Fabric
di: Haghi, Pouya, et al.
Pubblicazione: (2025)