Swimba: Switch Mamba Model Scales State Space Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Zhixu, Chitty-Venkata, Krishna Teja, Emani, Murali, Vishwanath, Venkatram, Li, Hai Helen, Chen, Yiran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
par: Thapa, Krishu K, et autres
Publié: (2025)
par: Thapa, Krishu K, et autres
Publié: (2025)
BaKlaVa -- Budgeted Allocation of KV cache for Long-context Inference
par: Gulhan, Ahmed Burak, et autres
Publié: (2025)
par: Gulhan, Ahmed Burak, et autres
Publié: (2025)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
MoPEQ: Mixture of Mixed Precision Quantized Experts
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
par: Ma, Haiyue, et autres
Publié: (2025)
par: Ma, Haiyue, et autres
Publié: (2025)
Quality Measures for Dynamic Graph Generative Models
par: Hosseini, Ryien, et autres
Publié: (2025)
par: Hosseini, Ryien, et autres
Publié: (2025)
A Deep Probabilistic Framework for Continuous Time Dynamic Graph Generation
par: Hosseini, Ryien, et autres
Publié: (2024)
par: Hosseini, Ryien, et autres
Publié: (2024)
SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models
par: Du, Zhixu, et autres
Publié: (2023)
par: Du, Zhixu, et autres
Publié: (2023)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
par: Shao, Zishan, et autres
Publié: (2025)
par: Shao, Zishan, et autres
Publié: (2025)
Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection
par: Zhan, Zheng, et autres
Publié: (2025)
par: Zhan, Zheng, et autres
Publié: (2025)
AERIS: Argonne Earth Systems Model for Reliable and Skillful Predictions
par: Hatanpää, Väinö, et autres
Publié: (2025)
par: Hatanpää, Väinö, et autres
Publié: (2025)
Sketch-Augmented Features Improve Learning Long-Range Dependencies in Graph Neural Networks
par: Hosseini, Ryien, et autres
Publié: (2025)
par: Hosseini, Ryien, et autres
Publié: (2025)
Mamba-3: Improved Sequence Modeling using State Space Principles
par: Lahoti, Aakash, et autres
Publié: (2026)
par: Lahoti, Aakash, et autres
Publié: (2026)
Extending $μ$P: Spectral Conditions for Feature Learning Across Optimizers
par: Gupta, Akshita, et autres
Publié: (2026)
par: Gupta, Akshita, et autres
Publié: (2026)
DyG-Mamba: Continuous State Space Modeling on Dynamic Graphs
par: Li, Dongyuan, et autres
Publié: (2024)
par: Li, Dongyuan, et autres
Publié: (2024)
Graph Mamba: Towards Learning on Graphs with State Space Models
par: Behrouz, Ali, et autres
Publié: (2024)
par: Behrouz, Ali, et autres
Publié: (2024)
Mamba State-Space Models Are Lyapunov-Stable Learners
par: Halloran, John T., et autres
Publié: (2024)
par: Halloran, John T., et autres
Publié: (2024)
PerfMamba: Performance Analysis and Pruning of Selective State Space Models
par: Asif, Abdullah Al, et autres
Publié: (2025)
par: Asif, Abdullah Al, et autres
Publié: (2025)
BarcodeMamba+: Advancing State-Space Models for Fungal Biodiversity Research
par: Gao, Tiancheng, et autres
Publié: (2025)
par: Gao, Tiancheng, et autres
Publié: (2025)
BarcodeMamba: State Space Models for Biodiversity Analysis
par: Gao, Tiancheng, et autres
Publié: (2024)
par: Gao, Tiancheng, et autres
Publié: (2024)
MemMamba: Rethinking Memory Patterns in State Space Model
par: Wang, Youjin, et autres
Publié: (2025)
par: Wang, Youjin, et autres
Publié: (2025)
MambaByte: Token-free Selective State Space Model
par: Wang, Junxiong, et autres
Publié: (2024)
par: Wang, Junxiong, et autres
Publié: (2024)
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
par: Gu, Albert, et autres
Publié: (2023)
par: Gu, Albert, et autres
Publié: (2023)
MambaLRP: Explaining Selective State Space Sequence Models
par: Jafari, Farnoush Rezaei, et autres
Publié: (2024)
par: Jafari, Farnoush Rezaei, et autres
Publié: (2024)
ss-Mamba: Semantic-Spline Selective State-Space Model
par: Ye, Zuochen
Publié: (2025)
par: Ye, Zuochen
Publié: (2025)
Foundation Models for Discovery and Exploration in Chemical Space
par: Wadell, Alexius, et autres
Publié: (2025)
par: Wadell, Alexius, et autres
Publié: (2025)
Deep Switching State Space Model (DS$^3$M) for Nonlinear Time Series Forecasting with Regime Switching
par: Xu, Xiuqin, et autres
Publié: (2021)
par: Xu, Xiuqin, et autres
Publié: (2021)
DG-Mamba: Robust and Efficient Dynamic Graph Structure Learning with Selective State Space Models
par: Yuan, Haonan, et autres
Publié: (2024)
par: Yuan, Haonan, et autres
Publié: (2024)
Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL
par: Lv, Qi, et autres
Publié: (2024)
par: Lv, Qi, et autres
Publié: (2024)
STG-Mamba: Spatial-Temporal Graph Learning via Selective State Space Model
par: Li, Lincan, et autres
Publié: (2024)
par: Li, Lincan, et autres
Publié: (2024)
FR-Mamba: Time-Series Physical Field Reconstruction Based on State Space Model
par: Long, Jiahuan, et autres
Publié: (2025)
par: Long, Jiahuan, et autres
Publié: (2025)
KalMamba: Towards Efficient Probabilistic State Space Models for RL under Uncertainty
par: Becker, Philipp, et autres
Publié: (2024)
par: Becker, Philipp, et autres
Publié: (2024)
SambaMixer: State of Health Prediction of Li-ion Batteries using Mamba State Space Models
par: Olalde-Verano, José Ignacio, et autres
Publié: (2024)
par: Olalde-Verano, José Ignacio, et autres
Publié: (2024)
A Theoretical Analysis of Mamba's Training Dynamics: Filtering Relevant Features for Generalization in State Space Models
par: Shandirasegaran, Mugunthan, et autres
Publié: (2026)
par: Shandirasegaran, Mugunthan, et autres
Publié: (2026)
The Computational Limits of State-Space Models and Mamba via the Lens of Circuit Complexity
par: Chen, Yifang, et autres
Publié: (2024)
par: Chen, Yifang, et autres
Publié: (2024)
Documents similaires
-
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
par: Thapa, Krishu K, et autres
Publié: (2025) -
BaKlaVa -- Budgeted Allocation of KV cache for Long-context Inference
par: Gulhan, Ahmed Burak, et autres
Publié: (2025)