MatMamba: A Matryoshka State Space Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shukla, Abhinav, Vemprala, Sai, Kusupati, Aditya, Kapoor, Ashish |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MatFormer: Nested Transformer for Elastic Inference
par: Devvrit, et autres
Publié: (2023)
par: Devvrit, et autres
Publié: (2023)
Matryoshka Representation Learning
par: Kusupati, Aditya, et autres
Publié: (2022)
par: Kusupati, Aditya, et autres
Publié: (2022)
Matryoshka Multimodal Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
R2Gen-Mamba: A Selective State Space Model for Radiology Report Generation
par: Sun, Yongheng, et autres
Publié: (2024)
par: Sun, Yongheng, et autres
Publié: (2024)
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
par: Liang, Weixin, et autres
Publié: (2025)
par: Liang, Weixin, et autres
Publié: (2025)
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023)
par: Gu, Jiatao, et autres
Publié: (2023)
BiasConnect: Investigating Bias Interactions in Text-to-Image Models
par: Shukla, Pushkar, et autres
Publié: (2025)
par: Shukla, Pushkar, et autres
Publié: (2025)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
On Structured State-Space Duality
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2025)
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2025)
RiverMamba: A State Space Model for Global River Discharge and Flood Forecasting
par: Eddin, Mohamad Hakam Shams, et autres
Publié: (2025)
par: Eddin, Mohamad Hakam Shams, et autres
Publié: (2025)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
Efficient Unstructured Pruning of Mamba State-Space Models for Resource-Constrained Environments
par: Shihab, Ibne Farabi, et autres
Publié: (2025)
par: Shihab, Ibne Farabi, et autres
Publié: (2025)
MambaTron: Efficient Cross-Modal Point Cloud Enhancement using Aggregate Selective State Space Modeling
par: Inaganti, Sai Tarun, et autres
Publié: (2025)
par: Inaganti, Sai Tarun, et autres
Publié: (2025)
MambaPEFT: Exploring Parameter-Efficient Fine-Tuning for Mamba
par: Yoshimura, Masakazu, et autres
Publié: (2024)
par: Yoshimura, Masakazu, et autres
Publié: (2024)
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
par: Hu, Vincent Tao, et autres
Publié: (2024)
par: Hu, Vincent Tao, et autres
Publié: (2024)
HELPER-X: A Unified Instructable Embodied Agent to Tackle Four Interactive Vision-Language Domains with Memory-Augmented Language Models
par: Sarch, Gabriel, et autres
Publié: (2024)
par: Sarch, Gabriel, et autres
Publié: (2024)
Vision Mamba: A Comprehensive Survey and Taxonomy
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
par: Xiao, Junfei, et autres
Publié: (2023)
par: Xiao, Junfei, et autres
Publié: (2023)
Mamba in Vision: A Comprehensive Survey of Techniques and Applications
par: Rahman, Md Maklachur, et autres
Publié: (2024)
par: Rahman, Md Maklachur, et autres
Publié: (2024)
Natural Language Generation from Visual Events: State-of-the-Art and Key Open Questions
par: Surikuchi, Aditya K, et autres
Publié: (2025)
par: Surikuchi, Aditya K, et autres
Publié: (2025)
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
par: Pan, Qingtao, et autres
Publié: (2026)
par: Pan, Qingtao, et autres
Publié: (2026)
Hybrid CNN with Chebyshev Polynomial Expansion for Medical Image Analysis
par: Roy, Abhinav, et autres
Publié: (2025)
par: Roy, Abhinav, et autres
Publié: (2025)
From Pixels to Prose: A Large Dataset of Dense Image Captions
par: Singla, Vasu, et autres
Publié: (2024)
par: Singla, Vasu, et autres
Publié: (2024)
State Space Model for New-Generation Network Alternative to Transformers: A Survey
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
DSS-GAN: Directional State Space GAN with Mamba backbone for Class-Conditional Image Synthesis
par: Ogonowski, Aleksander, et autres
Publié: (2026)
par: Ogonowski, Aleksander, et autres
Publié: (2026)
CBAGAN-RRT: Convolutional Block Attention Generative Adversarial Network for Sampling-Based Path Planning
par: Sagar, Abhinav, et autres
Publié: (2023)
par: Sagar, Abhinav, et autres
Publié: (2023)
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
par: Deitke, Matt, et autres
Publié: (2024)
par: Deitke, Matt, et autres
Publié: (2024)
How does My Model Fail? Automatic Identification and Interpretation of Physical Plausibility Failure Modes with Matryoshka Transcoders
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems
par: Liu, Xiaoze, et autres
Publié: (2026)
par: Liu, Xiaoze, et autres
Publié: (2026)
MuJo: Multimodal Joint Feature Space Learning for Human Activity Recognition
par: Fritsch, Stefan Gerd, et autres
Publié: (2024)
par: Fritsch, Stefan Gerd, et autres
Publié: (2024)
SkelMamba: A State Space Model for Efficient Skeleton Action Recognition of Neurological Disorders
par: Martinel, Niki, et autres
Publié: (2024)
par: Martinel, Niki, et autres
Publié: (2024)
RadMamba: Efficient Human Activity Recognition through Radar-based Micro-Doppler-Oriented Mamba State-Space Model
par: Wu, Yizhuo, et autres
Publié: (2025)
par: Wu, Yizhuo, et autres
Publié: (2025)
FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback
par: Singh, Ashish, et autres
Publié: (2023)
par: Singh, Ashish, et autres
Publié: (2023)
Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
par: Meng, Debin, et autres
Publié: (2025)
par: Meng, Debin, et autres
Publié: (2025)
Test-Time Training Done Right
par: Zhang, Tianyuan, et autres
Publié: (2025)
par: Zhang, Tianyuan, et autres
Publié: (2025)
MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection
par: Behrouz, Ali, et autres
Publié: (2024)
par: Behrouz, Ali, et autres
Publié: (2024)
Documents similaires
-
MatFormer: Nested Transformer for Elastic Inference
par: Devvrit, et autres
Publié: (2023) -
Matryoshka Representation Learning
par: Kusupati, Aditya, et autres
Publié: (2022) -
Matryoshka Multimodal Models
par: Cai, Mu, et autres
Publié: (2024) -
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024) -
R2Gen-Mamba: A Selective State Space Model for Radiology Report Generation
par: Sun, Yongheng, et autres
Publié: (2024)