VisionGRU: A Linear-Complexity RNN Model for Efficient Image Analysis
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Shicheng, Yin, Kaixuan, Chen, Weixing, Huang, Enbo, Liu, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models
by: Yin, Shicheng, et al.
Published: (2025)
by: Yin, Shicheng, et al.
Published: (2025)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
by: Yin, Shicheng, et al.
Published: (2026)
by: Yin, Shicheng, et al.
Published: (2026)
DRDM: A Disentangled Representations Diffusion Model for Synthesizing Realistic Person Images
by: Huang, Enbo, et al.
Published: (2024)
by: Huang, Enbo, et al.
Published: (2024)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
by: Yang, Timing, et al.
Published: (2025)
by: Yang, Timing, et al.
Published: (2025)
FacialPulse: An Efficient RNN-based Depression Detection via Temporal Facial Landmarks
by: Wang, Ruiqi, et al.
Published: (2024)
by: Wang, Ruiqi, et al.
Published: (2024)
Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering
by: Jiang, Kaixuan, et al.
Published: (2025)
by: Jiang, Kaixuan, et al.
Published: (2025)
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
LION: Linear Group RNN for 3D Object Detection in Point Clouds
by: Liu, Zhe, et al.
Published: (2024)
by: Liu, Zhe, et al.
Published: (2024)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
by: Tao, Hongyuan, et al.
Published: (2025)
by: Tao, Hongyuan, et al.
Published: (2025)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
by: Song, Xinshuai, et al.
Published: (2024)
by: Song, Xinshuai, et al.
Published: (2024)
PromptMID: Modal Invariant Descriptors Based on Diffusion and Vision Foundation Models for Optical-SAR Image Matching
by: Nie, Han, et al.
Published: (2025)
by: Nie, Han, et al.
Published: (2025)
PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathology
by: Huang, Yating, et al.
Published: (2025)
by: Huang, Yating, et al.
Published: (2025)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
by: Meng, Tian, et al.
Published: (2024)
by: Meng, Tian, et al.
Published: (2024)
Privacy-Shielded Image Compression: Defending Against Exploitation from Vision-Language Pretrained Models
by: Shen, Xuelin, et al.
Published: (2025)
by: Shen, Xuelin, et al.
Published: (2025)
RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task
by: Li, Chunshan, et al.
Published: (2025)
by: Li, Chunshan, et al.
Published: (2025)
KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
by: Xu, Wanshun, et al.
Published: (2025)
by: Xu, Wanshun, et al.
Published: (2025)
DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers
by: He, Kaixuan, et al.
Published: (2026)
by: He, Kaixuan, et al.
Published: (2026)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
by: Liu, Ting, et al.
Published: (2024)
by: Liu, Ting, et al.
Published: (2024)
EfficientMIL: Efficient Linear-Complexity MIL Method for WSI Classification
by: She, Chengying, et al.
Published: (2025)
by: She, Chengying, et al.
Published: (2025)
OccRWKV: Rethinking Efficient 3D Semantic Occupancy Prediction with Linear Complexity
by: Wang, Junming, et al.
Published: (2024)
by: Wang, Junming, et al.
Published: (2024)
GIM: Learning Generalizable Image Matcher From Internet Videos
by: Shen, Xuelun, et al.
Published: (2024)
by: Shen, Xuelun, et al.
Published: (2024)
LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
by: Li, Xiaohui, et al.
Published: (2025)
by: Li, Xiaohui, et al.
Published: (2025)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
by: Yang, Jiaxi, et al.
Published: (2026)
by: Yang, Jiaxi, et al.
Published: (2026)
IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model
by: Chen, Yifan, et al.
Published: (2026)
by: Chen, Yifan, et al.
Published: (2026)
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
by: Yin, Xiangyu, et al.
Published: (2025)
by: Yin, Xiangyu, et al.
Published: (2025)
Adaptive Fusion of Single-View and Multi-View Depth for Autonomous Driving
by: Cheng, JunDa, et al.
Published: (2024)
by: Cheng, JunDa, et al.
Published: (2024)
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
by: Lu, Kaixuan
Published: (2024)
by: Lu, Kaixuan
Published: (2024)
ReGLA: Efficient Receptive-Field Modeling with Gated Linear Attention Network
by: Li, Junzhou, et al.
Published: (2026)
by: Li, Junzhou, et al.
Published: (2026)
3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians
by: Wei, Zeming, et al.
Published: (2025)
by: Wei, Zeming, et al.
Published: (2025)
Multi-scale Quaternion CNN and BiGRU with Cross Self-attention Feature Fusion for Fault Diagnosis of Bearing
by: Liu, Huanbai, et al.
Published: (2024)
by: Liu, Huanbai, et al.
Published: (2024)
Hybrid State-Space and GRU-based Graph Tokenization Mamba for Hyperspectral Image Classification
by: Ahmad, Muhammad, et al.
Published: (2025)
by: Ahmad, Muhammad, et al.
Published: (2025)
MS-RNN: A Flexible Multi-Scale Framework for Spatiotemporal Predictive Learning
by: Ma, Zhifeng, et al.
Published: (2022)
by: Ma, Zhifeng, et al.
Published: (2022)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
by: Yin, Xiangyu, et al.
Published: (2025)
by: Yin, Xiangyu, et al.
Published: (2025)
Source-free Domain Adaptive Object Detection in Remote Sensing Images
by: Liu, Weixing, et al.
Published: (2024)
by: Liu, Weixing, et al.
Published: (2024)
1%>100%: High-Efficiency Visual Adapter with Complex Linear Projection Optimization
by: Yin, Dongshuo, et al.
Published: (2026)
by: Yin, Dongshuo, et al.
Published: (2026)
Describe-to-Score: Text-Guided Efficient Image Complexity Assessment
by: Liu, Shipeng, et al.
Published: (2025)
by: Liu, Shipeng, et al.
Published: (2025)
Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication
by: Zhang, Zhilong, et al.
Published: (2026)
by: Zhang, Zhilong, et al.
Published: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
In-context Prompt Learning for Test-time Vision Recognition with Frozen Vision-language Model
by: Yin, Junhui, et al.
Published: (2024)
by: Yin, Junhui, et al.
Published: (2024)
Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
by: Lu, Kaixuan, et al.
Published: (2024)
by: Lu, Kaixuan, et al.
Published: (2024)
Similar Items
-
DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models
by: Yin, Shicheng, et al.
Published: (2025) -
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
by: Yin, Shicheng, et al.
Published: (2026) -
DRDM: A Disentangled Representations Diffusion Model for Synthesizing Realistic Person Images
by: Huang, Enbo, et al.
Published: (2024) -
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
by: Yang, Timing, et al.
Published: (2025) -
FacialPulse: An Efficient RNN-based Depression Detection via Temporal Facial Landmarks
by: Wang, Ruiqi, et al.
Published: (2024)