Enregistré dans:
| Auteurs principaux: | Fan, Zehao, Liu, Zhenyu, Liu, Yunzhen, Hou, Yayue, Benmeziane, Hadjer, Maghraoui, Kaoutar El, Liu, Liu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.04476 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AnalogNAS-Bench: A NAS Benchmark for Analog In-Memory Computing
par: Bessalah, Aniss, et autres
Publié: (2025)
par: Bessalah, Aniss, et autres
Publié: (2025)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
par: Liu, Lian, et autres
Publié: (2025)
par: Liu, Lian, et autres
Publié: (2025)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025)
par: Fang, Yunhua, et autres
Publié: (2025)
On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training
par: Wu, Zhaoxian, et autres
Publié: (2024)
par: Wu, Zhaoxian, et autres
Publié: (2024)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
par: Gouk, Donghyun, et autres
Publié: (2025)
par: Gouk, Donghyun, et autres
Publié: (2025)
PIM Is All You Need: A CXL-Enabled GPU-Free System for Large Language Model Inference
par: Gu, Yufeng, et autres
Publié: (2025)
par: Gu, Yufeng, et autres
Publié: (2025)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
par: Pan, Yudong, et autres
Publié: (2026)
par: Pan, Yudong, et autres
Publié: (2026)
A Novel Extensible Simulation Framework for CXL-Enabled Systems
par: An, Yuda, et autres
Publié: (2024)
par: An, Yuda, et autres
Publié: (2024)
CXL-Interference: Analysis and Characterization in Modern Computer Systems
par: Mao, Shunyu, et autres
Publié: (2024)
par: Mao, Shunyu, et autres
Publié: (2024)
SparseST: Exploiting Data Sparsity in Spatiotemporal Modeling and Prediction
par: Wu, Junfeng, et autres
Publié: (2025)
par: Wu, Junfeng, et autres
Publié: (2025)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
par: Xie, Rui, et autres
Publié: (2024)
par: Xie, Rui, et autres
Publié: (2024)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
par: Kim, Dowon, et autres
Publié: (2025)
par: Kim, Dowon, et autres
Publié: (2025)
TRACE: Unlocking Effective CXL Bandwidth via Lossless Compression and Precision Scaling
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
par: Liu, Qunyou, et autres
Publié: (2026)
par: Liu, Qunyou, et autres
Publié: (2026)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024)
par: Skliar, Andrii, et autres
Publié: (2024)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
par: Hwang, Ranggi, et autres
Publié: (2023)
par: Hwang, Ranggi, et autres
Publié: (2023)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
par: Oh, Dongsuk, et autres
Publié: (2025)
par: Oh, Dongsuk, et autres
Publié: (2025)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
par: Liu, Qingyuan, et autres
Publié: (2025)
par: Liu, Qingyuan, et autres
Publié: (2025)
The Case for Persistent CXL switches
par: Hadi, Khan Shaikhul, et autres
Publié: (2025)
par: Hadi, Khan Shaikhul, et autres
Publié: (2025)
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
par: Kiyawat, Khyati, et autres
Publié: (2025)
par: Kiyawat, Khyati, et autres
Publié: (2025)
A Full-System Simulation Framework for CXL-Based SSD Memory System
par: Wang, Yaohui, et autres
Publié: (2025)
par: Wang, Yaohui, et autres
Publié: (2025)
AxMoE: Characterizing the Impact of Approximate Multipliers on Mixture-of-Experts DNN Architectures
par: Shende, Omkar B, et autres
Publié: (2026)
par: Shende, Omkar B, et autres
Publié: (2026)
CXL-DMSim: A Full-System CXL Disaggregated Memory Simulator With Comprehensive Silicon Validation
par: Wang, Yanjing, et autres
Publié: (2024)
par: Wang, Yanjing, et autres
Publié: (2024)
Continuous-Flow Data-Rate-Aware CNN Inference on FPGA
par: Habermann, Tobias, et autres
Publié: (2026)
par: Habermann, Tobias, et autres
Publié: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
par: Liu, Mingju, et autres
Publié: (2026)
par: Liu, Mingju, et autres
Publié: (2026)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024)
par: Yun, Sungmin, et autres
Publié: (2024)
FPGA-based Emulation and Device-Side Management for CXL-based Memory Tiering Systems
par: Chen, Yiqi, et autres
Publié: (2025)
par: Chen, Yiqi, et autres
Publié: (2025)
Cosmos: A CXL-Based Full In-Memory System for Approximate Nearest Neighbor Search
par: Ko, Seoyoung, et autres
Publié: (2025)
par: Ko, Seoyoung, et autres
Publié: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
par: Wang, Wenxun, et autres
Publié: (2025)
par: Wang, Wenxun, et autres
Publié: (2025)
Architectural and System Implications of CXL-enabled Tiered Memory
par: Yang, Yujie, et autres
Publié: (2025)
par: Yang, Yujie, et autres
Publié: (2025)
Hierarchical Mixture of Experts: Generalizable Learning for High-Level Synthesis
par: Li, Weikai, et autres
Publié: (2024)
par: Li, Weikai, et autres
Publié: (2024)
ACE-RTL: When Agentic Context Evolution Meets RTL-Specialized LLMs
par: Deng, Chenhui, et autres
Publié: (2026)
par: Deng, Chenhui, et autres
Publié: (2026)
Octopus: Enhancing CXL Memory Pods via Sparse Topology
par: Zhong, Yuhong, et autres
Publié: (2025)
par: Zhong, Yuhong, et autres
Publié: (2025)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
par: Wang, Jiapin, et autres
Publié: (2024)
par: Wang, Jiapin, et autres
Publié: (2024)
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
par: Ma, Songchen, et autres
Publié: (2026)
par: Ma, Songchen, et autres
Publié: (2026)
Data-Rate-Aware High-Speed CNN Inference on FPGAs
par: Habermann, Tobias, et autres
Publié: (2026)
par: Habermann, Tobias, et autres
Publié: (2026)
Documents similaires
-
AnalogNAS-Bench: A NAS Benchmark for Analog In-Memory Computing
par: Bessalah, Aniss, et autres
Publié: (2025) -
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
par: Liu, Lian, et autres
Publié: (2025) -
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025) -
On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training
par: Wu, Zhaoxian, et autres
Publié: (2024) -
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
par: Gouk, Donghyun, et autres
Publié: (2025)