Mamba-Shedder: Post-Transformer Compression for Efficient Selective Structured State Space Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Muñoz, J. Pablo, Yuan, Jinjie, Jain, Nilesh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiPruner: Balanced Structure Removal in Foundation Models
par: Muñoz, J. Pablo, et autres
Publié: (2025)
par: Muñoz, J. Pablo, et autres
Publié: (2025)
RTTC: Reward-Guided Collaborative Test-Time Compute
par: Muñoz, J. Pablo, et autres
Publié: (2025)
par: Muñoz, J. Pablo, et autres
Publié: (2025)
Key-Value Means: Transformers with Expandable Block-Recurrent Compressed Memory
par: Goldstein, Daniel, et autres
Publié: (2026)
par: Goldstein, Daniel, et autres
Publié: (2026)
Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure
par: Sarkar, Nilesh, et autres
Publié: (2026)
par: Sarkar, Nilesh, et autres
Publié: (2026)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
Reducing Selection Bias in Large Language Models
par: Eicher, J. E., et autres
Publié: (2024)
par: Eicher, J. E., et autres
Publié: (2024)
Enhancing Transformer RNNs with Multiple Temporal Perspectives
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
RWKV-7 "Goose" with Expressive Dynamic State Evolution
par: Peng, Bo, et autres
Publié: (2025)
par: Peng, Bo, et autres
Publié: (2025)
NRR-Phi: Text-to-State Mapping for Ambiguity Preservation in LLM Inference
par: Saito, Kei
Publié: (2026)
par: Saito, Kei
Publié: (2026)
ST-MambaSync: The Complement of Mamba and Transformers for Spatial-Temporal in Traffic Flow Prediction
par: Shao, Zhiqi, et autres
Publié: (2024)
par: Shao, Zhiqi, et autres
Publié: (2024)
Incentives or Ontology? A Structural Rebuttal to OpenAI's Hallucination Thesis
par: Ackermann, Richard, et autres
Publié: (2025)
par: Ackermann, Richard, et autres
Publié: (2025)
Fanar: An Arabic-Centric Multimodal Generative AI Platform
par: Fanar Team, et autres
Publié: (2025)
par: Fanar Team, et autres
Publié: (2025)
Safety, Security, and Cognitive Risks in State-Space Models: A Systematic Threat Analysis with Spectral, Stateful, and Capacity Attacks
par: Parmar, Manoj
Publié: (2026)
par: Parmar, Manoj
Publié: (2026)
Modeling Emotions and Ethics with Large Language Models
par: Chang, Edward Y.
Publié: (2024)
par: Chang, Edward Y.
Publié: (2024)
QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization
par: Khanna, Danush, et autres
Publié: (2025)
par: Khanna, Danush, et autres
Publié: (2025)
Graph Language Models
par: Plenz, Moritz, et autres
Publié: (2024)
par: Plenz, Moritz, et autres
Publié: (2024)
Generative AI for Synthetic Data Generation: Methods, Challenges and the Future
par: Guo, Xu, et autres
Publié: (2024)
par: Guo, Xu, et autres
Publié: (2024)
Layer-Wise Quantization: A Pragmatic and Effective Method for Quantizing LLMs Beyond Integer Bit-Levels
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
Change Is the Only Constant: Dynamic LLM Slicing based on Layer Redundancy
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
NRR-Core: Non-Resolution Reasoning as a Computational Framework for Contextual Identity and Ambiguity Preservation
par: Saito, Kei
Publié: (2025)
par: Saito, Kei
Publié: (2025)
ALISON: Fast and Effective Stylometric Authorship Obfuscation
par: Xing, Eric, et autres
Publié: (2024)
par: Xing, Eric, et autres
Publié: (2024)
CopySpec: Accelerating LLMs with Speculative Copy-and-Paste Without Compromising Quality
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
ACCORD: Closing the Commonsense Measurability Gap
par: Roewer-Després, François, et autres
Publié: (2024)
par: Roewer-Després, François, et autres
Publié: (2024)
Behavioural vs. Representational Systematicity in End-to-End Models: An Opinionated Survey
par: Vegner, Ivan, et autres
Publié: (2025)
par: Vegner, Ivan, et autres
Publié: (2025)
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
par: Venkatasubramanian, Venkat, et autres
Publié: (2024)
par: Venkatasubramanian, Venkat, et autres
Publié: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
par: Li, Zhaoyan, et autres
Publié: (2026)
par: Li, Zhaoyan, et autres
Publié: (2026)
In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models
par: Han, Pengrui, et autres
Publié: (2024)
par: Han, Pengrui, et autres
Publié: (2024)
The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models
par: Baxi, Rahul
Publié: (2025)
par: Baxi, Rahul
Publié: (2025)
Towards Measuring Goal-Directedness in AI Systems
par: Xu, Dylan, et autres
Publié: (2024)
par: Xu, Dylan, et autres
Publié: (2024)
Compressible Softmax-Attended Language under Incompressible Attention
par: Lee, Wonsuk
Publié: (2026)
par: Lee, Wonsuk
Publié: (2026)
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
par: Arnesen, Samuel, et autres
Publié: (2024)
par: Arnesen, Samuel, et autres
Publié: (2024)
OG-RAG: Ontology-Grounded Retrieval-Augmented Generation For Large Language Models
par: Sharma, Kartik, et autres
Publié: (2024)
par: Sharma, Kartik, et autres
Publié: (2024)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
par: Ren, Wanying, et autres
Publié: (2026)
par: Ren, Wanying, et autres
Publié: (2026)
TiVaT: A Transformer with a Single Unified Mechanism for Capturing Asynchronous Dependencies in Multivariate Time Series Forecasting
par: Ha, Junwoo, et autres
Publié: (2024)
par: Ha, Junwoo, et autres
Publié: (2024)
How Data Quality Affects Machine Learning Models for Credit Risk Assessment
par: Maurino, Andrea
Publié: (2025)
par: Maurino, Andrea
Publié: (2025)
Union of Experts: Adapting Hierarchical Routing to Equivalently Decomposed Transformer
par: Yang, Yujiao, et autres
Publié: (2025)
par: Yang, Yujiao, et autres
Publié: (2025)
Box Maze: A Process-Control Architecture for Reliable LLM Reasoning
par: Qiang, Zou
Publié: (2026)
par: Qiang, Zou
Publié: (2026)
Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs
par: Lei, Hang, et autres
Publié: (2025)
par: Lei, Hang, et autres
Publié: (2025)
ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers
par: Ghafari, Seyed Mohssen, et autres
Publié: (2025)
par: Ghafari, Seyed Mohssen, et autres
Publié: (2025)
Cognitively Inspired Components for Social Conversational Agents
par: Clay, Alex, et autres
Publié: (2023)
par: Clay, Alex, et autres
Publié: (2023)
Documents similaires
-
MultiPruner: Balanced Structure Removal in Foundation Models
par: Muñoz, J. Pablo, et autres
Publié: (2025) -
RTTC: Reward-Guided Collaborative Test-Time Compute
par: Muñoz, J. Pablo, et autres
Publié: (2025) -
Key-Value Means: Transformers with Expandable Block-Recurrent Compressed Memory
par: Goldstein, Daniel, et autres
Publié: (2026) -
Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure
par: Sarkar, Nilesh, et autres
Publié: (2026) -
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)