HALOC: Hardware-Aware Automatic Low-Rank Compression for Compact Neural Networks
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiao, Jinqi, Zhang, Chengming, Gong, Yu, Yin, Miao, Sui, Yang, Xiang, Lizhi, Tao, Dingwen, Yuan, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ELRT: Efficient Low-Rank Training for Compact Convolutional Neural Networks
por: Sui, Yang, et al.
Publicado: (2024)
por: Sui, Yang, et al.
Publicado: (2024)
MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition
por: Yang, Cheng, et al.
Publicado: (2024)
por: Yang, Cheng, et al.
Publicado: (2024)
COMCAT: Towards Efficient Compression and Customization of Attention-Based Vision Models
por: Xiao, Jinqi, et al.
Publicado: (2023)
por: Xiao, Jinqi, et al.
Publicado: (2023)
DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks
por: Fu, Yonggan, et al.
Publicado: (2022)
por: Fu, Yonggan, et al.
Publicado: (2022)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
FLARE: A Dataflow-Aware and Scalable Hardware Architecture for Neural-Hybrid Scientific Lossy Compression
por: Jia, Wenqi, et al.
Publicado: (2025)
por: Jia, Wenqi, et al.
Publicado: (2025)
Low-Rank Matrix Approximation for Neural Network Compression
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
GWLZ: A Group-wise Learning-based Lossy Compression Framework for Scientific Data
por: Jia, Wenqi, et al.
Publicado: (2024)
por: Jia, Wenqi, et al.
Publicado: (2024)
Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial Attacks
por: Schotthöfer, Steffen, et al.
Publicado: (2025)
por: Schotthöfer, Steffen, et al.
Publicado: (2025)
Theoretical Guarantees for Low-Rank Compression of Deep Neural Networks
por: Zhang, Shihao, et al.
Publicado: (2025)
por: Zhang, Shihao, et al.
Publicado: (2025)
Convolutional Neural Network Compression Based on Low-Rank Decomposition
por: He, Yaping, et al.
Publicado: (2024)
por: He, Yaping, et al.
Publicado: (2024)
Low-Rank Prehab: Preparing Neural Networks for SVD Compression
por: Qin, Haoran, et al.
Publicado: (2025)
por: Qin, Haoran, et al.
Publicado: (2025)
Beyond Low-Rank: Low-Rank Sparse Prompting via Spiking Neural Network and Prompt Factorization
por: Zhao, Yumiao, et al.
Publicado: (2026)
por: Zhao, Yumiao, et al.
Publicado: (2026)
Low-Rank Adapters Meet Neural Architecture Search for LLM Compression
por: Muñoz, J. Pablo, et al.
Publicado: (2025)
por: Muñoz, J. Pablo, et al.
Publicado: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
KVComp: A High-Performance, LLM-Aware, Lossy Compression Framework for KV Cache
por: Jiang, Bo, et al.
Publicado: (2025)
por: Jiang, Bo, et al.
Publicado: (2025)
HALOC-AxA: An Area/-Energy-Efficient Approximate Adder for Image Processing Application
por: Ziad, Hasnain A., et al.
Publicado: (2025)
por: Ziad, Hasnain A., et al.
Publicado: (2025)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
por: Yang, Cheng, et al.
Publicado: (2026)
por: Yang, Cheng, et al.
Publicado: (2026)
Hardware Radial Basis Function Neural Network Automatic Generation
por: Lucas Leiva
Publicado: (2011)
por: Lucas Leiva
Publicado: (2011)
Cooperative Hardware-Prompt Learning for Snapshot Compressive Imaging
por: Wang, Jiamian, et al.
Publicado: (2023)
por: Wang, Jiamian, et al.
Publicado: (2023)
Coding for Computation: Efficient Compression of Neural Networks for Reconfigurable Hardware
por: Rosenberger, Hans, et al.
Publicado: (2025)
por: Rosenberger, Hans, et al.
Publicado: (2025)
Compression and Inference of Spiking Neural Networks on Resource-Constrained Hardware
por: Jurzec, Karol C., et al.
Publicado: (2025)
por: Jurzec, Karol C., et al.
Publicado: (2025)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
por: Zhang, Kunlong, et al.
Publicado: (2025)
por: Zhang, Kunlong, et al.
Publicado: (2025)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
por: Zhang, Kunlong, et al.
Publicado: (2025)
por: Zhang, Kunlong, et al.
Publicado: (2025)
Learning to Compress: Local Rank and Information Compression in Deep Neural Networks
por: Patel, Niket, et al.
Publicado: (2024)
por: Patel, Niket, et al.
Publicado: (2024)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
por: Zhang, Chengming, et al.
Publicado: (2024)
por: Zhang, Chengming, et al.
Publicado: (2024)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
por: Xiang, Maoyang, et al.
Publicado: (2025)
por: Xiang, Maoyang, et al.
Publicado: (2025)
Hardware-Aware Quantum Kernel Design Based on Graph Neural Networks
por: Meng, Fanxu, et al.
Publicado: (2025)
por: Meng, Fanxu, et al.
Publicado: (2025)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022)
por: Xie, Xurong, et al.
Publicado: (2022)
Weed Out, Then Harvest: Dual Low-Rank Adaptation is an Effective Noisy Label Detector for Noise-Robust Learning
por: Yuan, Bo, et al.
Publicado: (2025)
por: Yuan, Bo, et al.
Publicado: (2025)
Compact Lifted Relaxations for Low-Rank Optimization
por: Cory-Wright, Ryan, et al.
Publicado: (2026)
por: Cory-Wright, Ryan, et al.
Publicado: (2026)
DisDet: Exploring Detectability of Backdoor Attack on Diffusion Models
por: Sui, Yang, et al.
Publicado: (2024)
por: Sui, Yang, et al.
Publicado: (2024)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
por: Xiao, Jinqi, et al.
Publicado: (2024)
por: Xiao, Jinqi, et al.
Publicado: (2024)
PACC: Protocol-Aware Cross-Layer Compression for Compact Network Traffic Representation
por: Guo, Zhaochen, et al.
Publicado: (2026)
por: Guo, Zhaochen, et al.
Publicado: (2026)
Overcoming Memory Constraints in Quantum Circuit Simulation with a High-Fidelity Compression Framework
por: Zhang, Boyuan, et al.
Publicado: (2024)
por: Zhang, Boyuan, et al.
Publicado: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
por: Huang, Wei, et al.
Publicado: (2023)
por: Huang, Wei, et al.
Publicado: (2023)
Simple yet Effective: Low-Rank Spatial Attention for Neural Operators
por: Yang, Zherui, et al.
Publicado: (2026)
por: Yang, Zherui, et al.
Publicado: (2026)
Automatic Differentiation is Essential in Training Neural Networks for Solving Differential Equations
por: Chen, Chuqi, et al.
Publicado: (2024)
por: Chen, Chuqi, et al.
Publicado: (2024)
Low-Rank Compression for IMC Arrays
por: Jeon, Kang Eun, et al.
Publicado: (2025)
por: Jeon, Kang Eun, et al.
Publicado: (2025)
LRConv-NeRV: Low Rank Convolution for Efficient Neural Video Compression
por: Shanableh, Tamer
Publicado: (2026)
por: Shanableh, Tamer
Publicado: (2026)
Ejemplares similares
-
ELRT: Efficient Low-Rank Training for Compact Convolutional Neural Networks
por: Sui, Yang, et al.
Publicado: (2024) -
MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition
por: Yang, Cheng, et al.
Publicado: (2024) -
COMCAT: Towards Efficient Compression and Customization of Attention-Based Vision Models
por: Xiao, Jinqi, et al.
Publicado: (2023) -
DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks
por: Fu, Yonggan, et al.
Publicado: (2022) -
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
por: Yang, Cheng, et al.
Publicado: (2025)