MonoSparse-CAM: Efficient Tree Model Processing via Monotonicity and Sparsity in CAMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Molom-Ochir, Tergel, Taylor, Brady, Li, Hai, Chen, Yiran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
CAMformer: Associative Memory is All You Need
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
Phi: Leveraging Pattern-based Hierarchical Sparsity for High-Efficiency Spiking Neural Networks
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
FractalCloud: A Fractal-Inspired Architecture for Efficient Large-Scale Point Cloud Processing
par: Fu, Yuzhe, et autres
Publié: (2025)
par: Fu, Yuzhe, et autres
Publié: (2025)
EXION: Exploiting Inter- and Intra-Iteration Output Sparsity for Diffusion Models
par: Heo, Jaehoon, et autres
Publié: (2025)
par: Heo, Jaehoon, et autres
Publié: (2025)
HyperSense: Hyperdimensional Intelligent Sensing for Energy-Efficient Sparse Data Processing
par: Yun, Sanggeon, et autres
Publié: (2024)
par: Yun, Sanggeon, et autres
Publié: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding
par: Fan, Wang, et autres
Publié: (2026)
par: Fan, Wang, et autres
Publié: (2026)
LaMAGIC2: Advanced Circuit Formulations for Language Model-Based Analog Topology Generation
par: Chang, Chen-Chia, et autres
Publié: (2025)
par: Chang, Chen-Chia, et autres
Publié: (2025)
NeuralMatrix: Compute the Entire Neural Networks with Linear Matrix Operations for Efficient Inference
par: Sun, Ruiqi, et autres
Publié: (2023)
par: Sun, Ruiqi, et autres
Publié: (2023)
VUSA: Virtually Upscaled Systolic Array Architecture to Exploit Unstructured Sparsity in AI Acceleration
par: Helal, Shereef, et autres
Publié: (2025)
par: Helal, Shereef, et autres
Publié: (2025)
LaMAGIC: Language-Model-based Topology Generation for Analog Integrated Circuits
par: Chang, Chen-Chia, et autres
Publié: (2024)
par: Chang, Chen-Chia, et autres
Publié: (2024)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
par: Jeong, Geonhwa, et autres
Publié: (2024)
par: Jeong, Geonhwa, et autres
Publié: (2024)
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
par: Kim, Taehyun, et autres
Publié: (2024)
par: Kim, Taehyun, et autres
Publié: (2024)
SwiftRL: Towards Efficient Reinforcement Learning on Real Processing-In-Memory Systems
par: Gogineni, Kailash, et autres
Publié: (2024)
par: Gogineni, Kailash, et autres
Publié: (2024)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
par: Müller, Mika Markus, et autres
Publié: (2025)
par: Müller, Mika Markus, et autres
Publié: (2025)
Dynamic Sparse Attention: Access Patterns and Architecture
par: Levy, Noam
Publié: (2026)
par: Levy, Noam
Publié: (2026)
Surrogates, Spikes, and Sparsity: Performance Analysis and Characterization of SNN Hyperparameters on Hardware
par: Aliyev, Ilkin, et autres
Publié: (2026)
par: Aliyev, Ilkin, et autres
Publié: (2026)
Explore Activation Sparsity in Recurrent LLMs for Energy-Efficient Neuromorphic Computing
par: Knunyants, Ivan, et autres
Publié: (2025)
par: Knunyants, Ivan, et autres
Publié: (2025)
Sparsity-Aware Hardware-Software Co-Design of Spiking Neural Networks: An Overview
par: Aliyev, Ilkin, et autres
Publié: (2024)
par: Aliyev, Ilkin, et autres
Publié: (2024)
Hardware/Software Co-Design of RISC-V Extensions for Accelerating Sparse DNNs on FPGAs
par: Sabih, Muhammad, et autres
Publié: (2025)
par: Sabih, Muhammad, et autres
Publié: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024)
par: Ma, Shaobo, et autres
Publié: (2024)
Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
par: Zhang, Hang, et autres
Publié: (2025)
par: Zhang, Hang, et autres
Publié: (2025)
FP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-Design
par: Xia, Haojun, et autres
Publié: (2024)
par: Xia, Haojun, et autres
Publié: (2024)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
par: Cong, Rongqing, et autres
Publié: (2024)
par: Cong, Rongqing, et autres
Publié: (2024)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
DRC-Coder: Automated DRC Checker Code Generation Using LLM Autonomous Agent
par: Chang, Chen-Chia, et autres
Publié: (2024)
par: Chang, Chen-Chia, et autres
Publié: (2024)
AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
Panacea: Novel DNN Accelerator using Accuracy-Preserving Asymmetric Quantization and Energy-Saving Bit-Slice Sparsity
par: Kam, Dongyun, et autres
Publié: (2024)
par: Kam, Dongyun, et autres
Publié: (2024)
LLM-Enhanced Bayesian Optimization for Efficient Analog Layout Constraint Generation
par: Chen, Guojin, et autres
Publié: (2024)
par: Chen, Guojin, et autres
Publié: (2024)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
SparseLUT: Sparse Connectivity Optimization for Lookup Table-based Deep Neural Networks
par: Lou, Binglei, et autres
Publié: (2025)
par: Lou, Binglei, et autres
Publié: (2025)
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
par: Wang, Hanrui, et autres
Publié: (2020)
par: Wang, Hanrui, et autres
Publié: (2020)
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
par: Li, Guoyu, et autres
Publié: (2025)
par: Li, Guoyu, et autres
Publié: (2025)
tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI
par: Nair, Harideep, et autres
Publié: (2024)
par: Nair, Harideep, et autres
Publié: (2024)
Efficient Task Transfer for HLS DSE
par: Ding, Zijian, et autres
Publié: (2024)
par: Ding, Zijian, et autres
Publié: (2024)
FPGA Divide-and-Conquer Placement using Deep Reinforcement Learning
par: Wang, Shang, et autres
Publié: (2024)
par: Wang, Shang, et autres
Publié: (2024)
Sorted Weight Sectioning for Energy-Efficient Unstructured Sparse DNNs on Compute-in-Memory Crossbars
par: Farias, Matheus, et autres
Publié: (2024)
par: Farias, Matheus, et autres
Publié: (2024)
Late Breaking Results: Quamba-SE: Soft-edge Quantizer for Activations in State Space Models
par: Chen, Yizhi, et autres
Publié: (2026)
par: Chen, Yizhi, et autres
Publié: (2026)
Documents similaires
-
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025) -
CAMformer: Associative Memory is All You Need
par: Molom-Ochir, Tergel, et autres
Publié: (2025) -
A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models
par: Guo, Cong, et autres
Publié: (2024) -
Phi: Leveraging Pattern-based Hierarchical Sparsity for High-Efficiency Spiking Neural Networks
par: Wei, Chiyue, et autres
Publié: (2025) -
FractalCloud: A Fractal-Inspired Architecture for Efficient Large-Scale Point Cloud Processing
par: Fu, Yuzhe, et autres
Publié: (2025)