SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kyung, Kwanhee, Yun, Sungmin, Ahn, Jung Ho |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024)
par: Yun, Sungmin, et autres
Publié: (2024)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)
par: Yun, Sungmin, et autres
Publié: (2025)
Block-SSD: A New Block-Based Blocking SSD Architecture
par: Wong, Ryan, et autres
Publié: (2024)
par: Wong, Ryan, et autres
Publié: (2024)
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
par: Oh, Dongsuk, et autres
Publié: (2025)
par: Oh, Dongsuk, et autres
Publié: (2025)
Containerized In-Storage Processing and Computing-Enabled SSD Disaggregation
par: Kwon, Miryeong, et autres
Publié: (2025)
par: Kwon, Miryeong, et autres
Publié: (2025)
A Host-SSD Collaborative Write Accelerator for LSM-Tree-Based Key-Value Stores
par: Kim, KiHwan, et autres
Publié: (2024)
par: Kim, KiHwan, et autres
Publié: (2024)
Cosmos: A CXL-Based Full In-Memory System for Approximate Nearest Neighbor Search
par: Ko, Seoyoung, et autres
Publié: (2025)
par: Ko, Seoyoung, et autres
Publié: (2025)
HillInfer: Efficient Long-Context LLM Inference on the Edge with Hierarchical KV Eviction using SmartSSD
par: Sun, He, et autres
Publié: (2026)
par: Sun, He, et autres
Publié: (2026)
Search-in-Memory (SiM): Reliable, Versatile, and Efficient Data Matching in SSD's NAND Flash Memory Chip for Data Indexing Acceleration
par: Chen, Yun-Chih, et autres
Publié: (2024)
par: Chen, Yun-Chih, et autres
Publié: (2024)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
A Full-System Simulation Framework for CXL-Based SSD Memory System
par: Wang, Yaohui, et autres
Publié: (2025)
par: Wang, Yaohui, et autres
Publié: (2025)
Towards Performance-Aware Allocation for Accelerated Machine Learning on GPU-SSD Systems
par: Gundawar, Ayush, et autres
Publié: (2024)
par: Gundawar, Ayush, et autres
Publié: (2024)
TCAM-SSD: A Framework for Search-Based Computing in Solid-State Drives
par: Wong, Ryan, et autres
Publié: (2024)
par: Wong, Ryan, et autres
Publié: (2024)
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026)
par: Gao, Hanyuan, et autres
Publié: (2026)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
par: Xu, Weikai, et autres
Publié: (2026)
par: Xu, Weikai, et autres
Publié: (2026)
RoMe: Row Granularity Access Memory System for Large Language Models
par: Nam, Hwayong, et autres
Publié: (2025)
par: Nam, Hwayong, et autres
Publié: (2025)
SkyByte: Architecting an Efficient Memory-Semantic CXL-based SSD with OS and Hardware Co-design
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Convolutions Predictable Offloading to an Accelerator: Formalization and Optimization
par: Husson, Benjamin, et autres
Publié: (2026)
par: Husson, Benjamin, et autres
Publié: (2026)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
Resilient and Secure Programmable System-on-Chip Accelerator Offload
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
An RDMA-First Object Storage System with SmartNIC Offload
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
CiFHER: A Chiplet-Based FHE Accelerator with a Resizable Structure
par: Kim, Sangpyo, et autres
Publié: (2023)
par: Kim, Sangpyo, et autres
Publié: (2023)
Optimizing Energy Efficiency in Subthreshold RISC-V Cores
par: Djupdal, Asbjørn, et autres
Publié: (2025)
par: Djupdal, Asbjørn, et autres
Publié: (2025)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
par: Huang, Wei-Hsing, et autres
Publié: (2025)
par: Huang, Wei-Hsing, et autres
Publié: (2025)
OffRAC: Offloading Through Remote Accelerator Calls
par: Yang, Ziyi, et autres
Publié: (2025)
par: Yang, Ziyi, et autres
Publié: (2025)
Reuse and Blend: Energy-Efficient Optical Neural Network Enabled by Weight Sharing
par: Xu, Bo, et autres
Publié: (2024)
par: Xu, Bo, et autres
Publié: (2024)
Sudoku: Decomposing DRAM Address Mapping into Component Functions
par: Wi, Minbok, et autres
Publié: (2025)
par: Wi, Minbok, et autres
Publié: (2025)
Increasing the Energy-Efficiency of Wearables Using Low-Precision Posit Arithmetic with PHEE
par: Mallasén, David, et autres
Publié: (2025)
par: Mallasén, David, et autres
Publié: (2025)
Virgo: Cluster-level Matrix Unit Integration in GPUs for Scalability and Energy Efficiency
par: Kim, Hansung, et autres
Publié: (2024)
par: Kim, Hansung, et autres
Publié: (2024)
16 Years of SPEC Power: An Analysis of x86 Energy Efficiency Trends
par: Tröpgen, Hannes, et autres
Publié: (2024)
par: Tröpgen, Hannes, et autres
Publié: (2024)
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
par: Pan, Xiurui, et autres
Publié: (2024)
par: Pan, Xiurui, et autres
Publié: (2024)
Evaluation of Run-Time Energy Efficiency using Controlled Approximation in a RISC-V Core
par: Delavari, Arvin, et autres
Publié: (2024)
par: Delavari, Arvin, et autres
Publié: (2024)
Offloading Data Center Tax
par: Revankar, Akshay, et autres
Publié: (2025)
par: Revankar, Akshay, et autres
Publié: (2025)
Modeling PFAS in Semiconductor Manufacturing to Quantify Trade-offs in Energy Efficiency and Environmental Impact of Computing Systems
par: Elgamal, Mariam, et autres
Publié: (2025)
par: Elgamal, Mariam, et autres
Publié: (2025)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
par: Fan, Zehao, et autres
Publié: (2025)
par: Fan, Zehao, et autres
Publié: (2025)
Theodosian: A Deep Dive into Memory-Hierarchy-Centric FHE Acceleration
par: Choi, Wonseok, et autres
Publié: (2025)
par: Choi, Wonseok, et autres
Publié: (2025)
IVE: An Accelerator for Single-Server Private Information Retrieval Using Versatile Processing Elements
par: Kim, Sangpyo, et autres
Publié: (2025)
par: Kim, Sangpyo, et autres
Publié: (2025)
Ramping Up Open-Source RISC-V Cores: Assessing the Energy Efficiency of Superscalar, Out-of-Order Execution
par: Fu, Zexin, et autres
Publié: (2025)
par: Fu, Zexin, et autres
Publié: (2025)
How to Increase Energy Efficiency with a Single Linux Command
par: Jelvani, Alborz, et autres
Publié: (2025)
par: Jelvani, Alborz, et autres
Publié: (2025)
Documents similaires
-
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024) -
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025) -
Block-SSD: A New Block-Based Blocking SSD Architecture
par: Wong, Ryan, et autres
Publié: (2024) -
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
par: Oh, Dongsuk, et autres
Publié: (2025) -
Containerized In-Storage Processing and Computing-Enabled SSD Disaggregation
par: Kwon, Miryeong, et autres
Publié: (2025)