Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Yiqi, Pan, Yudong, Wang, Mengdi, Zhao, Shixin, Zhu, Haonan, Han, Yinhe, Zhang, Lei, Wang, Ying |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
von: Xue, Chenhao, et al.
Veröffentlicht: (2026)
von: Xue, Chenhao, et al.
Veröffentlicht: (2026)
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
Theseus: Exploring Efficient Wafer-Scale Chip Design for Large Language Models
von: Zhu, Jingchen, et al.
Veröffentlicht: (2024)
von: Zhu, Jingchen, et al.
Veröffentlicht: (2024)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
von: Pan, Yudong, et al.
Veröffentlicht: (2026)
von: Pan, Yudong, et al.
Veröffentlicht: (2026)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
von: Liu, Lian, et al.
Veröffentlicht: (2025)
von: Liu, Lian, et al.
Veröffentlicht: (2025)
CIMple: Standard-cell SRAM-based CIM with LUT-based split softmax for attention acceleration
von: Ahn, Bas, et al.
Veröffentlicht: (2026)
von: Ahn, Bas, et al.
Veröffentlicht: (2026)
COMET: Towards Partical W4A4KV4 LLMs Serving
von: Liu, Lian, et al.
Veröffentlicht: (2024)
von: Liu, Lian, et al.
Veröffentlicht: (2024)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
von: Liu, Lian, et al.
Veröffentlicht: (2026)
von: Liu, Lian, et al.
Veröffentlicht: (2026)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
TL-nvSRAM-CIM: Ultra-High-Density Three-Level ReRAM-Assisted Computing-in-nvSRAM with DC-Power Free Restore and Ternary MAC Operations
von: Wang, Dengfeng, et al.
Veröffentlicht: (2023)
von: Wang, Dengfeng, et al.
Veröffentlicht: (2023)
Network Design for Wafer-Scale Systems with Wafer-on-Wafer Hybrid Bonding
von: Iff, Patrick, et al.
Veröffentlicht: (2026)
von: Iff, Patrick, et al.
Veröffentlicht: (2026)
CLASS: A Controller-Centric Layout Synthesizer for Dynamic Quantum Circuits
von: Chen, Yu, et al.
Veröffentlicht: (2025)
von: Chen, Yu, et al.
Veröffentlicht: (2025)
OpenACM: An Open-Source SRAM-Based Approximate CiM Compiler
von: Zhou, Yiqi, et al.
Veröffentlicht: (2026)
von: Zhou, Yiqi, et al.
Veröffentlicht: (2026)
GEM3D CIM General Purpose Matrix Computation Using 3D Integrated SRAM eDRAM Hybrid Compute In Memory on Memory Architecture
von: Chakraborty, Subhradip, et al.
Veröffentlicht: (2026)
von: Chakraborty, Subhradip, et al.
Veröffentlicht: (2026)
CIM-MLC: A Multi-level Compilation Stack for Computing-In-Memory Accelerators
von: Qu, Songyun, et al.
Veröffentlicht: (2024)
von: Qu, Songyun, et al.
Veröffentlicht: (2024)
PIMSYN: Synthesizing Processing-in-memory CNN Accelerators
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
SRAM-PG: Power Delivery Network Benchmarks from SRAM Circuits
von: Shen, Shan, et al.
Veröffentlicht: (2024)
von: Shen, Shan, et al.
Veröffentlicht: (2024)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
von: Zhang, Jingyao, et al.
Veröffentlicht: (2025)
von: Zhang, Jingyao, et al.
Veröffentlicht: (2025)
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
A 28nm 1.80Mb/mm2 Digital/Analog Hybrid SRAM-CIM Macro Using 2D-Weighted Capacitor Array for Complex Number Mac Operations
von: Konno, Shota, et al.
Veröffentlicht: (2025)
von: Konno, Shota, et al.
Veröffentlicht: (2025)
Switch-Less Dragonfly on Wafers: A Scalable Interconnection Architecture based on Wafer-Scale Integration
von: Feng, Yinxiao, et al.
Veröffentlicht: (2024)
von: Feng, Yinxiao, et al.
Veröffentlicht: (2024)
TRAPTI: Time-Resolved Analysis for SRAM Banking and Power Gating Optimization in Embedded Transformer Inference
von: Klhufek, Jan, et al.
Veröffentlicht: (2026)
von: Klhufek, Jan, et al.
Veröffentlicht: (2026)
ASiM: Modeling and Analyzing Inference Accuracy of SRAM-Based Analog CiM Circuits
von: Zhang, Wenlun, et al.
Veröffentlicht: (2024)
von: Zhang, Wenlun, et al.
Veröffentlicht: (2024)
Acore-CIM: build accurate and reliable mixed-signal CIM cores with RISC-V controlled self-calibration
von: Numan, Omar, et al.
Veröffentlicht: (2025)
von: Numan, Omar, et al.
Veröffentlicht: (2025)
DarwinWafer: A Wafer-Scale Neuromorphic Chip
von: Zhu, Xiaolei, et al.
Veröffentlicht: (2025)
von: Zhu, Xiaolei, et al.
Veröffentlicht: (2025)
ModSRAM: Algorithm-Hardware Co-Design for Large Number Modular Multiplication in SRAM
von: Ku, Jonathan, et al.
Veröffentlicht: (2024)
von: Ku, Jonathan, et al.
Veröffentlicht: (2024)
A System Architecture for Low Latency Multiprogramming Quantum Computing
von: Zhao, Yilun, et al.
Veröffentlicht: (2026)
von: Zhao, Yilun, et al.
Veröffentlicht: (2026)
High-Level Surface Code Decoding via Parallel FFNNs on CIM Platforms
von: Wang, Hao, et al.
Veröffentlicht: (2024)
von: Wang, Hao, et al.
Veröffentlicht: (2024)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
von: Sun, Xiaotian, et al.
Veröffentlicht: (2024)
von: Sun, Xiaotian, et al.
Veröffentlicht: (2024)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity
von: Duan, Cenlin, et al.
Veröffentlicht: (2024)
von: Duan, Cenlin, et al.
Veröffentlicht: (2024)
3DGauCIM: Accelerating Static/Dynamic 3D Gaussian Splatting via Digital CIM for High Frame Rate Real-Time Edge Rendering
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
Efficient SRAM-PIM Co-design by Joint Exploration of Value-Level and Bit-Level Sparsity
von: Duan, Cenlin, et al.
Veröffentlicht: (2025)
von: Duan, Cenlin, et al.
Veröffentlicht: (2025)
EdgeCIM: A Hardware-Software Co-Design for CIM-Based Acceleration of Small Language Models
von: Bazzi, Jinane, et al.
Veröffentlicht: (2026)
von: Bazzi, Jinane, et al.
Veröffentlicht: (2026)
A Systematic Characterization of LLM Inference on GPUs
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025) -
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
von: Yu, Jinxin, et al.
Veröffentlicht: (2026) -
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
von: Chen, Jinwu, et al.
Veröffentlicht: (2026) -
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
von: Xue, Chenhao, et al.
Veröffentlicht: (2026) -
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)