Mamba-3: Improved Sequence Modeling using State Space Principles
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lahoti, Aakash, Li, Kevin Y., Chen, Berlin, Wang, Caitlin, Bick, Aviv, Kolter, J. Zico, Dao, Tri, Gu, Albert |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers
par: Hwang, Sukjun, et autres
Publié: (2024)
par: Hwang, Sukjun, et autres
Publié: (2024)
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
par: Gu, Albert, et autres
Publié: (2023)
par: Gu, Albert, et autres
Publié: (2023)
Chimera: State Space Models Beyond Sequences
par: Lahoti, Aakash, et autres
Publié: (2025)
par: Lahoti, Aakash, et autres
Publié: (2025)
Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models
par: Bick, Aviv, et autres
Publié: (2024)
par: Bick, Aviv, et autres
Publié: (2024)
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
par: Dao, Tri, et autres
Publié: (2024)
par: Dao, Tri, et autres
Publié: (2024)
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
par: Paliotta, Daniele, et autres
Publié: (2025)
par: Paliotta, Daniele, et autres
Publié: (2025)
Understanding the Skill Gap in Recurrent Language Models: The Role of the Gather-and-Aggregate Mechanism
par: Bick, Aviv, et autres
Publié: (2025)
par: Bick, Aviv, et autres
Publié: (2025)
Retrieval-Aware Distillation for Transformer-SSM Hybrids
par: Bick, Aviv, et autres
Publié: (2026)
par: Bick, Aviv, et autres
Publié: (2026)
Mimetic Initialization Helps State Space Models Learn to Recall
par: Trockman, Asher, et autres
Publié: (2024)
par: Trockman, Asher, et autres
Publié: (2024)
Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing
par: Bick, Aviv, et autres
Publié: (2025)
par: Bick, Aviv, et autres
Publié: (2025)
FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
Weight Ensembling Improves Reasoning in Language Models
par: Dang, Xingyu, et autres
Publié: (2025)
par: Dang, Xingyu, et autres
Publié: (2025)
Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence Modeling
par: Schiff, Yair, et autres
Publié: (2024)
par: Schiff, Yair, et autres
Publié: (2024)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
par: Akinwande, Victor, et autres
Publié: (2024)
par: Akinwande, Victor, et autres
Publié: (2024)
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
par: Huang, Benhao, et autres
Publié: (2026)
par: Huang, Benhao, et autres
Publié: (2026)
Why is SAM Robust to Label Noise?
par: Baek, Christina, et autres
Publié: (2024)
par: Baek, Christina, et autres
Publié: (2024)
Mimetic Initialization of MLPs
par: Trockman, Asher, et autres
Publié: (2026)
par: Trockman, Asher, et autres
Publié: (2026)
Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks
par: Kim, Eungyeup, et autres
Publié: (2026)
par: Kim, Eungyeup, et autres
Publié: (2026)
One-Step Diffusion Distillation via Deep Equilibrium Models
par: Geng, Zhengyang, et autres
Publié: (2023)
par: Geng, Zhengyang, et autres
Publié: (2023)
Massive Activations in Large Language Models
par: Sun, Mingjie, et autres
Publié: (2024)
par: Sun, Mingjie, et autres
Publié: (2024)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
par: Li, Kevin Y., et autres
Publié: (2024)
par: Li, Kevin Y., et autres
Publié: (2024)
Sharpened Lazy Incremental Quasi-Newton Method
par: Lahoti, Aakash, et autres
Publié: (2023)
par: Lahoti, Aakash, et autres
Publié: (2023)
The Mamba in the Llama: Distilling and Accelerating Hybrid Models
par: Wang, Junxiong, et autres
Publié: (2024)
par: Wang, Junxiong, et autres
Publié: (2024)
Predicting the Performance of Black-box LLMs through Follow-up Queries
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
Improved Mean Flows: On the Challenges of Fastforward Generative Models
par: Geng, Zhengyang, et autres
Publié: (2025)
par: Geng, Zhengyang, et autres
Publié: (2025)
Diffusing Differentiable Representations
par: Savani, Yash, et autres
Publié: (2024)
par: Savani, Yash, et autres
Publié: (2024)
MambaLRP: Explaining Selective State Space Sequence Models
par: Jafari, Farnoush Rezaei, et autres
Publié: (2024)
par: Jafari, Farnoush Rezaei, et autres
Publié: (2024)
Generative Posterior Networks for Approximately Bayesian Epistemic Uncertainty Estimation
par: Roderick, Melrose, et autres
Publié: (2023)
par: Roderick, Melrose, et autres
Publié: (2023)
An Axiomatic Approach to Model-Agnostic Concept Explanations
par: Feng, Zhili, et autres
Publié: (2024)
par: Feng, Zhili, et autres
Publié: (2024)
Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
par: Ai, Xinyue, et autres
Publié: (2025)
par: Ai, Xinyue, et autres
Publié: (2025)
A Simple and Effective Pruning Approach for Large Language Models
par: Sun, Mingjie, et autres
Publié: (2023)
par: Sun, Mingjie, et autres
Publié: (2023)
Forcing Diffuse Distributions out of Language Models
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Understanding Hallucinations in Diffusion Models through Mode Interpolation
par: Aithal, Sumukh K, et autres
Publié: (2024)
par: Aithal, Sumukh K, et autres
Publié: (2024)
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Prompt Recovery for Image Generation Models: A Comparative Study of Discrete Optimizers
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces
par: Ota, Toshihiro
Publié: (2024)
par: Ota, Toshihiro
Publié: (2024)
The Mixing method: low-rank coordinate descent for semidefinite programming with diagonal constraints
par: Wang, Po-Wei, et autres
Publié: (2017)
par: Wang, Po-Wei, et autres
Publié: (2017)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models
par: Wang, Junxiong, et autres
Publié: (2025)
par: Wang, Junxiong, et autres
Publié: (2025)
Documents similaires
-
Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers
par: Hwang, Sukjun, et autres
Publié: (2024) -
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
par: Gu, Albert, et autres
Publié: (2023) -
Chimera: State Space Models Beyond Sequences
par: Lahoti, Aakash, et autres
Publié: (2025) -
Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models
par: Bick, Aviv, et autres
Publié: (2024) -
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
par: Dao, Tri, et autres
Publié: (2024)