Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chiang, Hung-Yueh, Chang, Chi-Chih, Frumkin, Natalia, Wu, Kai-Chiang, Abdelfattah, Mohamed S., Marculescu, Diana |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quamba: A Post-Training Quantization Recipe for Selective State Space Models
by: Chiang, Hung-Yueh, et al.
Published: (2024)
by: Chiang, Hung-Yueh, et al.
Published: (2024)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
by: Frumkin, Natalia, et al.
Published: (2026)
by: Frumkin, Natalia, et al.
Published: (2026)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
by: Chi, Tien-Yu, et al.
Published: (2025)
by: Chi, Tien-Yu, et al.
Published: (2025)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
by: Chiang, Hung-Yueh, et al.
Published: (2025)
by: Chiang, Hung-Yueh, et al.
Published: (2025)
SCAN-Edge: Finding MobileNet-speed Hybrid Networks for Diverse Edge Devices via Hardware-Aware Evolutionary Search
by: Chiang, Hung-Yueh, et al.
Published: (2024)
by: Chiang, Hung-Yueh, et al.
Published: (2024)
Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
by: Frumkin, Natalia, et al.
Published: (2025)
by: Frumkin, Natalia, et al.
Published: (2025)
V"Mean"ba: Visual State Space Models only need 1 hidden dimension
by: Chi, Tien-Yu, et al.
Published: (2024)
by: Chi, Tien-Yu, et al.
Published: (2024)
ACALSim: A Scalable Parallel Simulation Framework for High-Performance System Design Space Exploration
by: Lin, Wei-Fen, et al.
Published: (2026)
by: Lin, Wei-Fen, et al.
Published: (2026)
ELANA: A Simple Energy and Latency Analyzer for LLMs
by: Chiang, Hung-Yueh, et al.
Published: (2025)
by: Chiang, Hung-Yueh, et al.
Published: (2025)
Jumping through Local Minima: Quantization in the Loss Landscape of Vision Transformers
by: Frumkin, Natalia, et al.
Published: (2023)
by: Frumkin, Natalia, et al.
Published: (2023)
Similarity Trajectories: Linking Sampling Process to Artifacts in Diffusion-Generated Images
by: Menn, Dennis, et al.
Published: (2024)
by: Menn, Dennis, et al.
Published: (2024)
On Latency Predictors for Neural Architecture Search
by: Akhauri, Yash, et al.
Published: (2024)
by: Akhauri, Yash, et al.
Published: (2024)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
by: AbouElhamayed, Ahmed F., et al.
Published: (2025)
by: AbouElhamayed, Ahmed F., et al.
Published: (2025)
QOPS: A Compiler Framework for Quantum Circuit Simulation Acceleration with Profile Guided Optimizations
by: Wu, Yu-Tsung, et al.
Published: (2024)
by: Wu, Yu-Tsung, et al.
Published: (2024)
Dual-Select FMA Butterfly for FFT: Eliminating Twiddle Factor Singularities with Bounded Precomputed Ratios
by: Bergach, Mohamed Amine
Published: (2026)
by: Bergach, Mohamed Amine
Published: (2026)
When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
by: Bergach, Mohamed Amine
Published: (2026)
by: Bergach, Mohamed Amine
Published: (2026)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
by: Chu, Kexin, et al.
Published: (2025)
by: Chu, Kexin, et al.
Published: (2025)
Systolic Sparse Tensor Slices: FPGA Building Blocks for Sparse and Dense AI Acceleration
by: Taka, Endri, et al.
Published: (2025)
by: Taka, Endri, et al.
Published: (2025)
On General Linearly Implicit Quantized State System Methods
by: Bergonzi, Mariana, et al.
Published: (2025)
by: Bergonzi, Mariana, et al.
Published: (2025)
Training Transformers in Cosine Coefficient Space
by: Bergach, Mohamed Amine
Published: (2026)
by: Bergach, Mohamed Amine
Published: (2026)
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
by: Huang, Ning-Chi, et al.
Published: (2024)
by: Huang, Ning-Chi, et al.
Published: (2024)
FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices
by: Chai, Yuji, et al.
Published: (2025)
by: Chai, Yuji, et al.
Published: (2025)
MambaCPU: Enhanced Correlation Mining with State Space Models for CPU Performance Prediction
by: Liu, Xiaoman
Published: (2024)
by: Liu, Xiaoman
Published: (2024)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
by: Chang, Chi-Chih, et al.
Published: (2025)
by: Chang, Chi-Chih, et al.
Published: (2025)
Regression Language Models for Code
by: Akhauri, Yash, et al.
Published: (2025)
by: Akhauri, Yash, et al.
Published: (2025)
Accurate and Scalable Many-Node Simulation
by: Eyerman, Stijn, et al.
Published: (2024)
by: Eyerman, Stijn, et al.
Published: (2024)
Efficient Hybrid Amplitude-Phase Quantization for Multi-Antenna Relay System
by: Kim, Changdae, et al.
Published: (2025)
by: Kim, Changdae, et al.
Published: (2025)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
by: Benazir, Afsara, et al.
Published: (2025)
by: Benazir, Afsara, et al.
Published: (2025)
Quantitative Analysis of Deeply Quantized Tiny Neural Networks Robust to Adversarial Attacks
by: Zakariyya, Idris, et al.
Published: (2025)
by: Zakariyya, Idris, et al.
Published: (2025)
Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation
by: Ke, Chih-Hua
Published: (2026)
by: Ke, Chih-Hua
Published: (2026)
PIM or CXL-PIM? Understanding Architectural Trade-offs Through Large-Scale Benchmarking
by: Lee, I-Ting, et al.
Published: (2025)
by: Lee, I-Ting, et al.
Published: (2025)
Shortest-Path FFT: Optimal SIMD Instruction Scheduling via Graph Search
by: Bergach, Mohamed Amine
Published: (2026)
by: Bergach, Mohamed Amine
Published: (2026)
From 8 Seconds to 370ms: Kernel-Fused SAR Imaging on Apple Silicon via Single-Dispatch FFT Pipelines
by: Bergach, Mohamed Amine
Published: (2026)
by: Bergach, Mohamed Amine
Published: (2026)
DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers
by: Maurya, Avinash, et al.
Published: (2026)
by: Maurya, Avinash, et al.
Published: (2026)
Scalable Packed Layouts for Vector-Length-Agnostic ML Code Generation
by: Beysel, Ege, et al.
Published: (2026)
by: Beysel, Ege, et al.
Published: (2026)
The Unwritten Contract of Cloud-based Elastic Solid-State Drives
by: Wang, Yingjia, et al.
Published: (2025)
by: Wang, Yingjia, et al.
Published: (2025)
Performance Optimization of 3D Stencil Computation on ARM Scalable Vector Extension
by: Chen, Hongguang
Published: (2025)
by: Chen, Hongguang
Published: (2025)
Queen: A quick, scalable, and comprehensive quantum circuit simulation for supercomputing
by: Wang, Chuan-Chi, et al.
Published: (2024)
by: Wang, Chuan-Chi, et al.
Published: (2024)
A Causal Decision Making Model for Knowledge Management Capabilities to Innovation Performance in Taiwan's High-Tech Industry
by: Hung-Fan Chang
Published: (2010)
by: Hung-Fan Chang
Published: (2010)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
by: Lipshitz, Baraq, et al.
Published: (2025)
by: Lipshitz, Baraq, et al.
Published: (2025)
Similar Items
-
Quamba: A Post-Training Quantization Recipe for Selective State Space Models
by: Chiang, Hung-Yueh, et al.
Published: (2024) -
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
by: Frumkin, Natalia, et al.
Published: (2026) -
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
by: Chi, Tien-Yu, et al.
Published: (2025) -
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
by: Chiang, Hung-Yueh, et al.
Published: (2025) -
SCAN-Edge: Finding MobileNet-speed Hybrid Networks for Diverse Edge Devices via Hardware-Aware Evolutionary Search
by: Chiang, Hung-Yueh, et al.
Published: (2024)