RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Timing, Wei, Guoyizhe, Yuille, Alan, Wang, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025)
par: Wei, Guoyizhe, et autres
Publié: (2025)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
par: Wang, Feng, et autres
Publié: (2025)
par: Wang, Feng, et autres
Publié: (2025)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
par: Li, Zhuowan, et autres
Publié: (2022)
par: Li, Zhuowan, et autres
Publié: (2022)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
par: Mei, Jieru, et autres
Publié: (2024)
par: Mei, Jieru, et autres
Publié: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
Autoregressive Pretraining with Mamba in Vision
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
par: Wang, Feng, et autres
Publié: (2023)
par: Wang, Feng, et autres
Publié: (2023)
VisionGRU: A Linear-Complexity RNN Model for Efficient Image Analysis
par: Yin, Shicheng, et autres
Publié: (2024)
par: Yin, Shicheng, et autres
Publié: (2024)
Efficient Large Multi-modal Models via Visual Context Compression
par: Chen, Jieneng, et autres
Publié: (2024)
par: Chen, Jieneng, et autres
Publié: (2024)
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
par: Yuille, Alan, et autres
Publié: (2026)
par: Yuille, Alan, et autres
Publié: (2026)
Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning
par: Wei, Guoyizhe, et autres
Publié: (2026)
par: Wei, Guoyizhe, et autres
Publié: (2026)
ImOV3D: Learning Open-Vocabulary Point Clouds 3D Object Detection from Only 2D Images
par: Yang, Timing, et autres
Publié: (2024)
par: Yang, Timing, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising
par: Lin, Han, et autres
Publié: (2026)
par: Lin, Han, et autres
Publié: (2026)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
par: Paul, Soumava, et autres
Publié: (2026)
par: Paul, Soumava, et autres
Publié: (2026)
LION: Linear Group RNN for 3D Object Detection in Point Clouds
par: Liu, Zhe, et autres
Publié: (2024)
par: Liu, Zhe, et autres
Publié: (2024)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Large Language Models are Universal Reasoners for Visual Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
DINeMo: Learning Neural Mesh Models with no 3D Annotations
par: Guo, Weijie, et autres
Publié: (2025)
par: Guo, Weijie, et autres
Publié: (2025)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors
par: Paul, Soumava, et autres
Publié: (2024)
par: Paul, Soumava, et autres
Publié: (2024)
Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets
par: Chen, Yixiong, et autres
Publié: (2024)
par: Chen, Yixiong, et autres
Publié: (2024)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
par: Chen, Yuanhong, et autres
Publié: (2023)
par: Chen, Yuanhong, et autres
Publié: (2023)
Visual Mamba: A Survey and New Outlooks
par: Xu, Rui, et autres
Publié: (2024)
par: Xu, Rui, et autres
Publié: (2024)
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
par: Wang, Chengkun, et autres
Publié: (2024)
par: Wang, Chengkun, et autres
Publié: (2024)
A Survey on Visual Mamba
par: Zhang, Hanwei, et autres
Publié: (2024)
par: Zhang, Hanwei, et autres
Publié: (2024)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models
par: Guan, Yaohan, et autres
Publié: (2026)
par: Guan, Yaohan, et autres
Publié: (2026)
CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion Model
par: Yuan, Xiaoding, et autres
Publié: (2024)
par: Yuan, Xiaoding, et autres
Publié: (2024)
DefMamba: Deformable Visual State Space Model
par: Liu, Leiye, et autres
Publié: (2025)
par: Liu, Leiye, et autres
Publié: (2025)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024)
par: Chen, Wenchao, et autres
Publié: (2024)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
par: Xiao, Junfei, et autres
Publié: (2024)
par: Xiao, Junfei, et autres
Publié: (2024)
StruMamba3D: Exploring Structural Mamba for Self-supervised Point Cloud Representation Learning
par: Wang, Chuxin, et autres
Publié: (2025)
par: Wang, Chuxin, et autres
Publié: (2025)
Why mamba is effective? Exploit Linear Transformer-Mamba Network for Multi-Modality Image Fusion
par: Zhu, Chenguang, et autres
Publié: (2024)
par: Zhu, Chenguang, et autres
Publié: (2024)
Documents similaires
-
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
par: Wang, Feng, et autres
Publié: (2024) -
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024) -
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025) -
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025) -
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
par: Wang, Feng, et autres
Publié: (2025)