MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yunze, Yi, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024)
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
di: Song, Chull Hwan, et al.
Pubblicazione: (2024)
di: Song, Chull Hwan, et al.
Pubblicazione: (2024)
Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment
di: Jiang, Yankai, et al.
Pubblicazione: (2024)
di: Jiang, Yankai, et al.
Pubblicazione: (2024)
Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models
di: Horawalavithana, Sameera, et al.
Pubblicazione: (2026)
di: Horawalavithana, Sameera, et al.
Pubblicazione: (2026)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
di: Fu, Teng, et al.
Pubblicazione: (2025)
di: Fu, Teng, et al.
Pubblicazione: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
di: Chen, Yinda, et al.
Pubblicazione: (2024)
di: Chen, Yinda, et al.
Pubblicazione: (2024)
PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
Dynamic Vision Mamba
di: Wu, Mengxuan, et al.
Pubblicazione: (2025)
di: Wu, Mengxuan, et al.
Pubblicazione: (2025)
Revisiting the Integration of Convolution and Attention for Vision Backbone
di: Zhu, Lei, et al.
Pubblicazione: (2024)
di: Zhu, Lei, et al.
Pubblicazione: (2024)
MambaScope: Coarse-to-Fine Scoping for Efficient Vision Mamba
di: Liu, Shanhui, et al.
Pubblicazione: (2025)
di: Liu, Shanhui, et al.
Pubblicazione: (2025)
Pretraining Objective Matters in Extreme Low-Data FGVC: A Backbone-Controlled Study
di: Hackett, Alexander, et al.
Pubblicazione: (2026)
di: Hackett, Alexander, et al.
Pubblicazione: (2026)
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale
di: Liu, Haozhe, et al.
Pubblicazione: (2024)
di: Liu, Haozhe, et al.
Pubblicazione: (2024)
Unleash the Potential of CLIP for Video Highlight Detection
di: Han, Donghoon, et al.
Pubblicazione: (2024)
di: Han, Donghoon, et al.
Pubblicazione: (2024)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
Semi-Supervised Masked Autoencoders: Unlocking Vision Transformer Potential with Limited Data
di: Faysal, Atik, et al.
Pubblicazione: (2026)
di: Faysal, Atik, et al.
Pubblicazione: (2026)
Selective Visual Prompting in Vision Mamba
di: Yao, Yifeng, et al.
Pubblicazione: (2024)
di: Yao, Yifeng, et al.
Pubblicazione: (2024)
Towards Robust Vision Transformer via Masked Adaptive Ensemble
di: Lin, Fudong, et al.
Pubblicazione: (2024)
di: Lin, Fudong, et al.
Pubblicazione: (2024)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
di: Demidov, Dmitry, et al.
Pubblicazione: (2023)
di: Demidov, Dmitry, et al.
Pubblicazione: (2023)
Beyond MACs: Hardware Efficient Architecture Design for Vision Backbones
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
A Survey on Mamba Architecture for Vision Applications
di: Ibrahim, Fady, et al.
Pubblicazione: (2025)
di: Ibrahim, Fady, et al.
Pubblicazione: (2025)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
di: Wu, Meihan, et al.
Pubblicazione: (2024)
di: Wu, Meihan, et al.
Pubblicazione: (2024)
CellMamba: Adaptive Mamba for Accurate and Efficient Cell Detection
di: Liu, Ruochen, et al.
Pubblicazione: (2025)
di: Liu, Ruochen, et al.
Pubblicazione: (2025)
Cross-Task Multi-Branch Vision Transformer for Facial Expression and Mask Wearing Classification
di: Zhu, Armando, et al.
Pubblicazione: (2024)
di: Zhu, Armando, et al.
Pubblicazione: (2024)
CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
di: Li, Chenxi, et al.
Pubblicazione: (2025)
di: Li, Chenxi, et al.
Pubblicazione: (2025)
Beyond ZOH: Advanced Discretization Strategies for Vision Mamba
di: Ibrahim, Fady, et al.
Pubblicazione: (2026)
di: Ibrahim, Fady, et al.
Pubblicazione: (2026)
RandAR: Decoder-only Autoregressive Visual Generation in Random Orders
di: Pang, Ziqi, et al.
Pubblicazione: (2024)
di: Pang, Ziqi, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Generative Pretrained Transformer
di: Hanlin, Wen
Pubblicazione: (2024)
di: Hanlin, Wen
Pubblicazione: (2024)
OuroMamba: A Data-Free Quantization Framework for Vision Mamba
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions
di: Wen, Liangjian, et al.
Pubblicazione: (2025)
di: Wen, Liangjian, et al.
Pubblicazione: (2025)
MVNet: Hyperspectral Remote Sensing Image Classification Based on Hybrid Mamba-Transformer Vision Backbone Architecture
di: Li, Guandong, et al.
Pubblicazione: (2025)
di: Li, Guandong, et al.
Pubblicazione: (2025)
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
di: Aniraj, Ananthu, et al.
Pubblicazione: (2025)
di: Aniraj, Ananthu, et al.
Pubblicazione: (2025)
Vision-LSTM: xLSTM as Generic Vision Backbone
di: Alkin, Benedikt, et al.
Pubblicazione: (2024)
di: Alkin, Benedikt, et al.
Pubblicazione: (2024)
$MV_{Hybrid}$: Improving Spatial Transcriptomics Prediction with Hybrid State Space-Vision Transformer Backbone in Pathology Vision Foundation Models
di: Cho, Won June, et al.
Pubblicazione: (2025)
di: Cho, Won June, et al.
Pubblicazione: (2025)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
di: Tang, Haotian, et al.
Pubblicazione: (2024)
di: Tang, Haotian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025) -
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
di: Liu, Hanpeng, et al.
Pubblicazione: (2026) -
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024) -
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024) -
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
di: Song, Chull Hwan, et al.
Pubblicazione: (2024)