Gespeichert in:
| Hauptverfasser: | Fan, Zehao, Liu, Zhenyu, Liu, Yunzhen, Hou, Yayue, Benmeziane, Hadjer, Maghraoui, Kaoutar El, Liu, Liu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2512.04476 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AnalogNAS-Bench: A NAS Benchmark for Analog In-Memory Computing
von: Bessalah, Aniss, et al.
Veröffentlicht: (2025)
von: Bessalah, Aniss, et al.
Veröffentlicht: (2025)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
von: Liu, Lian, et al.
Veröffentlicht: (2025)
von: Liu, Lian, et al.
Veröffentlicht: (2025)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training
von: Wu, Zhaoxian, et al.
Veröffentlicht: (2024)
von: Wu, Zhaoxian, et al.
Veröffentlicht: (2024)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
von: Gouk, Donghyun, et al.
Veröffentlicht: (2025)
von: Gouk, Donghyun, et al.
Veröffentlicht: (2025)
PIM Is All You Need: A CXL-Enabled GPU-Free System for Large Language Model Inference
von: Gu, Yufeng, et al.
Veröffentlicht: (2025)
von: Gu, Yufeng, et al.
Veröffentlicht: (2025)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
von: Pan, Yudong, et al.
Veröffentlicht: (2026)
von: Pan, Yudong, et al.
Veröffentlicht: (2026)
A Novel Extensible Simulation Framework for CXL-Enabled Systems
von: An, Yuda, et al.
Veröffentlicht: (2024)
von: An, Yuda, et al.
Veröffentlicht: (2024)
CXL-Interference: Analysis and Characterization in Modern Computer Systems
von: Mao, Shunyu, et al.
Veröffentlicht: (2024)
von: Mao, Shunyu, et al.
Veröffentlicht: (2024)
SparseST: Exploiting Data Sparsity in Spatiotemporal Modeling and Prediction
von: Wu, Junfeng, et al.
Veröffentlicht: (2025)
von: Wu, Junfeng, et al.
Veröffentlicht: (2025)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
von: Xie, Rui, et al.
Veröffentlicht: (2024)
von: Xie, Rui, et al.
Veröffentlicht: (2024)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
von: Bambhaniya, Abhimanyu, et al.
Veröffentlicht: (2026)
von: Bambhaniya, Abhimanyu, et al.
Veröffentlicht: (2026)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
von: Kim, Dowon, et al.
Veröffentlicht: (2025)
von: Kim, Dowon, et al.
Veröffentlicht: (2025)
TRACE: Unlocking Effective CXL Bandwidth via Lossless Compression and Precision Scaling
von: Xie, Rui, et al.
Veröffentlicht: (2025)
von: Xie, Rui, et al.
Veröffentlicht: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
von: Skliar, Andrii, et al.
Veröffentlicht: (2024)
von: Skliar, Andrii, et al.
Veröffentlicht: (2024)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
von: Wang, Zhao, et al.
Veröffentlicht: (2025)
von: Wang, Zhao, et al.
Veröffentlicht: (2025)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
von: Hwang, Ranggi, et al.
Veröffentlicht: (2023)
von: Hwang, Ranggi, et al.
Veröffentlicht: (2023)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
von: Kim, Jungwoo, et al.
Veröffentlicht: (2026)
von: Kim, Jungwoo, et al.
Veröffentlicht: (2026)
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
von: Oh, Dongsuk, et al.
Veröffentlicht: (2025)
von: Oh, Dongsuk, et al.
Veröffentlicht: (2025)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
von: Liu, Qingyuan, et al.
Veröffentlicht: (2025)
von: Liu, Qingyuan, et al.
Veröffentlicht: (2025)
The Case for Persistent CXL switches
von: Hadi, Khan Shaikhul, et al.
Veröffentlicht: (2025)
von: Hadi, Khan Shaikhul, et al.
Veröffentlicht: (2025)
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
von: Kiyawat, Khyati, et al.
Veröffentlicht: (2025)
von: Kiyawat, Khyati, et al.
Veröffentlicht: (2025)
A Full-System Simulation Framework for CXL-Based SSD Memory System
von: Wang, Yaohui, et al.
Veröffentlicht: (2025)
von: Wang, Yaohui, et al.
Veröffentlicht: (2025)
AxMoE: Characterizing the Impact of Approximate Multipliers on Mixture-of-Experts DNN Architectures
von: Shende, Omkar B, et al.
Veröffentlicht: (2026)
von: Shende, Omkar B, et al.
Veröffentlicht: (2026)
CXL-DMSim: A Full-System CXL Disaggregated Memory Simulator With Comprehensive Silicon Validation
von: Wang, Yanjing, et al.
Veröffentlicht: (2024)
von: Wang, Yanjing, et al.
Veröffentlicht: (2024)
Continuous-Flow Data-Rate-Aware CNN Inference on FPGA
von: Habermann, Tobias, et al.
Veröffentlicht: (2026)
von: Habermann, Tobias, et al.
Veröffentlicht: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
von: Liu, Mingju, et al.
Veröffentlicht: (2026)
von: Liu, Mingju, et al.
Veröffentlicht: (2026)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
von: Yun, Sungmin, et al.
Veröffentlicht: (2024)
FPGA-based Emulation and Device-Side Management for CXL-based Memory Tiering Systems
von: Chen, Yiqi, et al.
Veröffentlicht: (2025)
von: Chen, Yiqi, et al.
Veröffentlicht: (2025)
Cosmos: A CXL-Based Full In-Memory System for Approximate Nearest Neighbor Search
von: Ko, Seoyoung, et al.
Veröffentlicht: (2025)
von: Ko, Seoyoung, et al.
Veröffentlicht: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
von: Xie, Rui, et al.
Veröffentlicht: (2025)
von: Xie, Rui, et al.
Veröffentlicht: (2025)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
Architectural and System Implications of CXL-enabled Tiered Memory
von: Yang, Yujie, et al.
Veröffentlicht: (2025)
von: Yang, Yujie, et al.
Veröffentlicht: (2025)
Hierarchical Mixture of Experts: Generalizable Learning for High-Level Synthesis
von: Li, Weikai, et al.
Veröffentlicht: (2024)
von: Li, Weikai, et al.
Veröffentlicht: (2024)
ACE-RTL: When Agentic Context Evolution Meets RTL-Specialized LLMs
von: Deng, Chenhui, et al.
Veröffentlicht: (2026)
von: Deng, Chenhui, et al.
Veröffentlicht: (2026)
Octopus: Enhancing CXL Memory Pods via Sparse Topology
von: Zhong, Yuhong, et al.
Veröffentlicht: (2025)
von: Zhong, Yuhong, et al.
Veröffentlicht: (2025)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
von: Ma, Songchen, et al.
Veröffentlicht: (2026)
von: Ma, Songchen, et al.
Veröffentlicht: (2026)
Data-Rate-Aware High-Speed CNN Inference on FPGAs
von: Habermann, Tobias, et al.
Veröffentlicht: (2026)
von: Habermann, Tobias, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
AnalogNAS-Bench: A NAS Benchmark for Analog In-Memory Computing
von: Bessalah, Aniss, et al.
Veröffentlicht: (2025) -
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
von: Liu, Lian, et al.
Veröffentlicht: (2025) -
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
von: Fang, Yunhua, et al.
Veröffentlicht: (2025) -
On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training
von: Wu, Zhaoxian, et al.
Veröffentlicht: (2024) -
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
von: Gouk, Donghyun, et al.
Veröffentlicht: (2025)