DeciMamba: Exploring the Length Extrapolation Potential of Mamba
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ben-Kish, Assaf, Zimerman, Itamar, Abu-Hussein, Shady, Cohen, Nadav, Globerson, Amir, Wolf, Lior, Giryes, Raja |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Overflow Prevention Enhances Long-Context Recurrent LLMs
par: Ben-Kish, Assaf, et autres
Publié: (2025)
par: Ben-Kish, Assaf, et autres
Publié: (2025)
Differential Mamba
par: Schneider, Nadav, et autres
Publié: (2025)
par: Schneider, Nadav, et autres
Publié: (2025)
Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States
par: Razin, Noam, et autres
Publié: (2024)
par: Razin, Noam, et autres
Publié: (2024)
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025)
par: Eisenstadt, Roy, et autres
Publié: (2025)
The Hidden Attention of Mamba Models
par: Ali, Ameen, et autres
Publié: (2024)
par: Ali, Ameen, et autres
Publié: (2024)
CLIMP: Contrastive Language-Image Mamba Pretraining
par: Shabtay, Nimrod, et autres
Publié: (2026)
par: Shabtay, Nimrod, et autres
Publié: (2026)
Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
par: Alon, Bar, et autres
Publié: (2026)
par: Alon, Bar, et autres
Publié: (2026)
Provable Benefits of Complex Parameterizations for Structured State Space Models
par: Ran-Milo, Yuval, et autres
Publié: (2024)
par: Ran-Milo, Yuval, et autres
Publié: (2024)
Mitigating Open-Vocabulary Caption Hallucinations
par: Ben-Kish, Assaf, et autres
Publié: (2023)
par: Ben-Kish, Assaf, et autres
Publié: (2023)
UDPM: Upsampling Diffusion Probabilistic Models
par: Abu-Hussein, Shady, et autres
Publié: (2023)
par: Abu-Hussein, Shady, et autres
Publié: (2023)
Mamba Modulation: On the Length Generalization of Mamba
par: Lu, Peng, et autres
Publié: (2025)
par: Lu, Peng, et autres
Publié: (2025)
On the Expressivity of Selective State-Space Layers: A Multivariate Polynomial Approach
par: Cohen-Karlik, Edo, et autres
Publié: (2025)
par: Cohen-Karlik, Edo, et autres
Publié: (2025)
PRILoRA: Pruned and Rank-Increasing Low-Rank Adaptation
par: Benedek, Nadav, et autres
Publié: (2024)
par: Benedek, Nadav, et autres
Publié: (2024)
Deep Active Speech Cancellation with Mamba-Masking Network
par: Mishaly, Yehuda, et autres
Publié: (2025)
par: Mishaly, Yehuda, et autres
Publié: (2025)
ADIR: Adaptive Diffusion for Image Reconstruction
par: Abu-Hussein, Shady, et autres
Publié: (2022)
par: Abu-Hussein, Shady, et autres
Publié: (2022)
Diffusion Models are Robust Pretrainers
par: Yagoda, Mika, et autres
Publié: (2025)
par: Yagoda, Mika, et autres
Publié: (2025)
Image-Adaptive GAN based Reconstruction
par: Hussein, Shady Abu, et autres
Publié: (2019)
par: Hussein, Shady Abu, et autres
Publié: (2019)
MambaSL: Exploring Single-Layer Mamba for Time Series Classification
par: Jung, Yoo-Min, et autres
Publié: (2026)
par: Jung, Yoo-Min, et autres
Publié: (2026)
Explaining Modern Gated-Linear RNNs via a Unified Implicit Attention Formulation
par: Zimerman, Itamar, et autres
Publié: (2024)
par: Zimerman, Itamar, et autres
Publié: (2024)
Jacobian-aware Posterior Sampling for Inverse Problems
par: Hen, Liav, et autres
Publié: (2025)
par: Hen, Liav, et autres
Publié: (2025)
Anatomical Token Uncertainty for Transformer-Guided Active MRI Acquisition
par: Ayzenberg, Lev, et autres
Publié: (2026)
par: Ayzenberg, Lev, et autres
Publié: (2026)
Exploring Graph Mamba: A Comprehensive Survey on State-Space Models for Graph Learning
par: Atitallah, Safa Ben, et autres
Publié: (2024)
par: Atitallah, Safa Ben, et autres
Publié: (2024)
MambaPEFT: Exploring Parameter-Efficient Fine-Tuning for Mamba
par: Yoshimura, Masakazu, et autres
Publié: (2024)
par: Yoshimura, Masakazu, et autres
Publié: (2024)
Diverse Subset Selection via Norm-Based Sampling and Orthogonality
par: Bar, Noga, et autres
Publié: (2024)
par: Bar, Noga, et autres
Publié: (2024)
DifuzCam: Replacing Camera Lens with a Mask and a Diffusion Model
par: Yosef, Erez, et autres
Publié: (2024)
par: Yosef, Erez, et autres
Publié: (2024)
Hybrid Mamba-Transformer Decoder for Error-Correcting Codes
par: Cohen, Shy-el, et autres
Publié: (2025)
par: Cohen, Shy-el, et autres
Publié: (2025)
TextMamba: Scene Text Detector with Mamba
par: Zhao, Qiyan, et autres
Publié: (2025)
par: Zhao, Qiyan, et autres
Publié: (2025)
Exploring the Limitations of Mamba in COPY and CoT Reasoning
par: Ren, Ruifeng, et autres
Publié: (2024)
par: Ren, Ruifeng, et autres
Publié: (2024)
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
par: Singh, Vaibhav, et autres
Publié: (2025)
par: Singh, Vaibhav, et autres
Publié: (2025)
ms-Mamba: Multi-scale Mamba for Time-Series Forecasting
par: Karadag, Yusuf Meric, et autres
Publié: (2025)
par: Karadag, Yusuf Meric, et autres
Publié: (2025)
InfoMamba: An Attention-Free Hybrid Mamba-Transformer Model
par: Wang, Youjin, et autres
Publié: (2026)
par: Wang, Youjin, et autres
Publié: (2026)
AdaMamba: Adaptive Frequency-Gated Mamba for Long-Term Time Series Forecasting
par: Jiang, Xudong, et autres
Publié: (2026)
par: Jiang, Xudong, et autres
Publié: (2026)
AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
LuMamba: Latent Unified Mamba for Electrode Topology-Invariant and Efficient EEG Modeling
par: Broustail, Danaé, et autres
Publié: (2026)
par: Broustail, Danaé, et autres
Publié: (2026)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
eMamba: Efficient Acceleration Framework for Mamba Models in Edge Computing
par: Kim, Jiyong, et autres
Publié: (2025)
par: Kim, Jiyong, et autres
Publié: (2025)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2024)
par: Wang, Junyu, et autres
Publié: (2024)
PIP: Positional-encoding Image Prior
par: Shabtay, Nimrod, et autres
Publié: (2022)
par: Shabtay, Nimrod, et autres
Publié: (2022)
Group Orthogonalization Regularization For Vision Models Adaptation and Robustness
par: Kurtz, Yoav, et autres
Publié: (2023)
par: Kurtz, Yoav, et autres
Publié: (2023)
ProtoSAM: One-Shot Medical Image Segmentation With Foundational Models
par: Ayzenberg, Lev, et autres
Publié: (2024)
par: Ayzenberg, Lev, et autres
Publié: (2024)
Documents similaires
-
Overflow Prevention Enhances Long-Context Recurrent LLMs
par: Ben-Kish, Assaf, et autres
Publié: (2025) -
Differential Mamba
par: Schneider, Nadav, et autres
Publié: (2025) -
Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States
par: Razin, Noam, et autres
Publié: (2024) -
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025) -
The Hidden Attention of Mamba Models
par: Ali, Ameen, et autres
Publié: (2024)