Enregistré dans:
| Auteurs principaux: | Zhao, Liang, Shao, Kunming, Liao, Zhipeng, Huang, Xijie, Cheng, Tim Kwang-Ting, Tsui, Chi-Ying, Zou, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.05743 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models
par: Shao, Kunming, et autres
Publié: (2026)
par: Shao, Kunming, et autres
Publié: (2026)
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
par: Shao, Kunming, et autres
Publié: (2025)
par: Shao, Kunming, et autres
Publié: (2025)
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
par: Liao, Zhipeng, et autres
Publié: (2025)
par: Liao, Zhipeng, et autres
Publié: (2025)
A Flexible Precision Scaling Deep Neural Network Accelerator with Efficient Weight Combination
par: Zhao, Liang, et autres
Publié: (2025)
par: Zhao, Liang, et autres
Publié: (2025)
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
par: Shao, Kunming, et autres
Publié: (2024)
par: Shao, Kunming, et autres
Publié: (2024)
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
par: Guo, Yan-Cheng, et autres
Publié: (2026)
par: Guo, Yan-Cheng, et autres
Publié: (2026)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
par: Liu, Shih-yang, et autres
Publié: (2023)
par: Liu, Shih-yang, et autres
Publié: (2023)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
par: Chen, Jinwu, et autres
Publié: (2026)
par: Chen, Jinwu, et autres
Publié: (2026)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
par: Zhao, Shixin, et autres
Publié: (2025)
par: Zhao, Shixin, et autres
Publié: (2025)
MixFP4: Enhancing NVFP4 with Adaptive FP4/INT4 Block Representations
par: Zou, Jiaxiang, et autres
Publié: (2026)
par: Zou, Jiaxiang, et autres
Publié: (2026)
3DGauCIM: Accelerating Static/Dynamic 3D Gaussian Splatting via Digital CIM for High Frame Rate Real-Time Edge Rendering
par: Huang, Wei-Hsing, et autres
Publié: (2025)
par: Huang, Wei-Hsing, et autres
Publié: (2025)
31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding
par: Dong, Pingcheng, et autres
Publié: (2026)
par: Dong, Pingcheng, et autres
Publié: (2026)
Acore-CIM: build accurate and reliable mixed-signal CIM cores with RISC-V controlled self-calibration
par: Numan, Omar, et autres
Publié: (2025)
par: Numan, Omar, et autres
Publié: (2025)
SEGA-DCIM: Design Space Exploration-Guided Automatic Digital CIM Compiler with Multiple Precision Support
par: Diao, Haikang, et autres
Publié: (2025)
par: Diao, Haikang, et autres
Publié: (2025)
CIMFlow: An Integrated Framework for Systematic Design and Evaluation of Digital CIM Architectures
par: Qi, Yingjie, et autres
Publié: (2025)
par: Qi, Yingjie, et autres
Publié: (2025)
MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation
par: Park, Dahoon, et autres
Publié: (2026)
par: Park, Dahoon, et autres
Publié: (2026)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
par: Qin, Shantian, et autres
Publié: (2025)
par: Qin, Shantian, et autres
Publié: (2025)
MGS: Markov Greedy Sums for Accurate Low-Bitwidth Floating-Point Accumulation
par: Natesh, Vikas, et autres
Publié: (2025)
par: Natesh, Vikas, et autres
Publié: (2025)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
EdgeCIM: A Hardware-Software Co-Design for CIM-Based Acceleration of Small Language Models
par: Bazzi, Jinane, et autres
Publié: (2026)
par: Bazzi, Jinane, et autres
Publié: (2026)
Unicorn-CIM: Uncovering the Vulnerability and Improving the Resilience of High-Precision Compute-in-Memory
par: Li, Qiufeng, et autres
Publié: (2025)
par: Li, Qiufeng, et autres
Publié: (2025)
High-Level Surface Code Decoding via Parallel FFNNs on CIM Platforms
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
par: Xuan, Zihao, et autres
Publié: (2026)
par: Xuan, Zihao, et autres
Publié: (2026)
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
par: Qi, Yingjie, et autres
Publié: (2025)
par: Qi, Yingjie, et autres
Publié: (2025)
CIMple: Standard-cell SRAM-based CIM with LUT-based split softmax for attention acceleration
par: Ahn, Bas, et autres
Publié: (2026)
par: Ahn, Bas, et autres
Publié: (2026)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
par: Lin, Xipeng, et autres
Publié: (2024)
par: Lin, Xipeng, et autres
Publié: (2024)
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
par: and, Yan-Cheng Guo, et autres
Publié: (2025)
par: and, Yan-Cheng Guo, et autres
Publié: (2025)
Enhancing CGRA Efficiency Through Aligned Compute and Communication Provisioning
par: Li, Zhaoying, et autres
Publié: (2024)
par: Li, Zhaoying, et autres
Publié: (2024)
Faster Inference of LLMs using FP8 on the Intel Gaudi
par: Lee, Joonhyung, et autres
Publié: (2025)
par: Lee, Joonhyung, et autres
Publié: (2025)
A 28nm 1.80Mb/mm2 Digital/Analog Hybrid SRAM-CIM Macro Using 2D-Weighted Capacitor Array for Complex Number Mac Operations
par: Konno, Shota, et autres
Publié: (2025)
par: Konno, Shota, et autres
Publié: (2025)
Hardware-Efficient CNNs: Interleaved Approximate FP32 Multipliers for Kernel Computation
par: Gowda, Bindu G, et autres
Publié: (2025)
par: Gowda, Bindu G, et autres
Publié: (2025)
DGEMM without FP64 Arithmetic - Using FP64 Emulation and FP8 Tensor Cores with Ozaki Scheme
par: Mukunoki, Daichi
Publié: (2025)
par: Mukunoki, Daichi
Publié: (2025)
APSQ: Additive Partial Sum Quantization with Algorithm-Hardware Co-Design
par: Tan, Yonghao, et autres
Publié: (2025)
par: Tan, Yonghao, et autres
Publié: (2025)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
par: Xu, Weikai, et autres
Publié: (2026)
par: Xu, Weikai, et autres
Publié: (2026)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
par: Xu, Weikai, et autres
Publié: (2025)
par: Xu, Weikai, et autres
Publié: (2025)
FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
GEM3D CIM General Purpose Matrix Computation Using 3D Integrated SRAM eDRAM Hybrid Compute In Memory on Memory Architecture
par: Chakraborty, Subhradip, et autres
Publié: (2026)
par: Chakraborty, Subhradip, et autres
Publié: (2026)
TMA-Adaptive FP8 Grouped GEMM: Eliminating Padding Requirements in Low-Precision Training and Inference on Hopper
par: Su, Zhongling, et autres
Publié: (2025)
par: Su, Zhongling, et autres
Publié: (2025)
Shift-Left Techniques in Electronic Design Automation: A Survey
par: Wu, Xinyue, et autres
Publié: (2025)
par: Wu, Xinyue, et autres
Publié: (2025)
Documents similaires
-
DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models
par: Shao, Kunming, et autres
Publié: (2026) -
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
par: Shao, Kunming, et autres
Publié: (2025) -
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
par: Liao, Zhipeng, et autres
Publié: (2025) -
A Flexible Precision Scaling Deep Neural Network Accelerator with Efficient Weight Combination
par: Zhao, Liang, et autres
Publié: (2025) -
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
par: Shao, Kunming, et autres
Publié: (2024)