Selective State Space Memory for Large Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ng, Chee, Fung, Yuen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning
by: Ng, Chee, et al.
Published: (2025)
by: Ng, Chee, et al.
Published: (2025)
ShadowMamba: State-Space Model with Boundary-Region Selective Scan for Shadow Removal
by: Zhu, Xiujin, et al.
Published: (2024)
by: Zhu, Xiujin, et al.
Published: (2024)
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
Large Language Models for Video Surveillance Applications
by: De Silva, Ulindu, et al.
Published: (2025)
by: De Silva, Ulindu, et al.
Published: (2025)
Educational Personalized Learning Path Planning with Large Language Models
by: Ng, Chee, et al.
Published: (2024)
by: Ng, Chee, et al.
Published: (2024)
Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
by: Atabuzzaman, Md., et al.
Published: (2025)
by: Atabuzzaman, Md., et al.
Published: (2025)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
by: Ren, Xiyu, et al.
Published: (2026)
by: Ren, Xiyu, et al.
Published: (2026)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
by: Nguyen, Thong, et al.
Published: (2025)
by: Nguyen, Thong, et al.
Published: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
by: Sun, Jiashuo, et al.
Published: (2024)
by: Sun, Jiashuo, et al.
Published: (2024)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
by: Liu, Xinqi, et al.
Published: (2024)
by: Liu, Xinqi, et al.
Published: (2024)
Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling
by: Nandi, Soumyaroop, et al.
Published: (2026)
by: Nandi, Soumyaroop, et al.
Published: (2026)
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2025)
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2025)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
by: Chung, Sangyun, et al.
Published: (2024)
by: Chung, Sangyun, et al.
Published: (2024)
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
by: Lee, Seulbi, et al.
Published: (2026)
by: Lee, Seulbi, et al.
Published: (2026)
Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
by: Yang, Le, et al.
Published: (2024)
by: Yang, Le, et al.
Published: (2024)
QMamba: Post-Training Quantization for Vision State Space Models
by: Li, Yinglong, et al.
Published: (2025)
by: Li, Yinglong, et al.
Published: (2025)
DAMamba: Vision State Space Model with Dynamic Adaptive Scan
by: Li, Tanzhe, et al.
Published: (2025)
by: Li, Tanzhe, et al.
Published: (2025)
Vision-Language Memory for Spatial Reasoning
by: Liu, Zuntao, et al.
Published: (2025)
by: Liu, Zuntao, et al.
Published: (2025)
VideoMamba: Spatio-Temporal Selective State Space Model
by: Park, Jinyoung, et al.
Published: (2024)
by: Park, Jinyoung, et al.
Published: (2024)
Similarity-Aware Selective State-Space Modeling for Semantic Correspondence
by: Kim, Seungwook, et al.
Published: (2025)
by: Kim, Seungwook, et al.
Published: (2025)
Personalized Large Vision-Language Models
by: Pham, Chau, et al.
Published: (2024)
by: Pham, Chau, et al.
Published: (2024)
Mamba-CL: Optimizing Selective State Space Model in Null Space for Continual Learning
by: Cheng, De, et al.
Published: (2024)
by: Cheng, De, et al.
Published: (2024)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
by: Lovenia, Holy, et al.
Published: (2023)
by: Lovenia, Holy, et al.
Published: (2023)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
by: Zhu, Yiqi, et al.
Published: (2025)
by: Zhu, Yiqi, et al.
Published: (2025)
Mobile Robot Navigation Using Hand-Drawn Maps: A Vision Language Model Approach
by: Tan, Aaron Hao, et al.
Published: (2025)
by: Tan, Aaron Hao, et al.
Published: (2025)
Bridging Hidden States in Vision-Language Models
by: Fein-Ashley, Benjamin, et al.
Published: (2025)
by: Fein-Ashley, Benjamin, et al.
Published: (2025)
A Tutorial on Explainable Image Classification for Dementia Stages Using Convolutional Neural Network and Gradient-weighted Class Activation Mapping
by: Yuen, Kevin Kam Fung
Published: (2024)
by: Yuen, Kevin Kam Fung
Published: (2024)
MemoryMamba: Memory-Augmented State Space Model for Defect Recognition
by: Wang, Qianning, et al.
Published: (2024)
by: Wang, Qianning, et al.
Published: (2024)
Towards Efficient Vision State Space Models via Token Merging
by: Park, Jinyoung, et al.
Published: (2025)
by: Park, Jinyoung, et al.
Published: (2025)
Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models
by: Zou, Xin, et al.
Published: (2024)
by: Zou, Xin, et al.
Published: (2024)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
QuoVLA: Quotient Space for Vision-Language-Action Models
by: Wang, Xuan, et al.
Published: (2026)
by: Wang, Xuan, et al.
Published: (2026)
Phantom of Latent for Large Language and Vision Models
by: Lee, Byung-Kwan, et al.
Published: (2024)
by: Lee, Byung-Kwan, et al.
Published: (2024)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
by: Lee, Jaewoo, et al.
Published: (2025)
by: Lee, Jaewoo, et al.
Published: (2025)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
by: Ilhan, Fatih, et al.
Published: (2026)
by: Ilhan, Fatih, et al.
Published: (2026)
EAMamba: Efficient All-Around Vision State Space Model for Image Restoration
by: Lin, Yu-Cheng, et al.
Published: (2025)
by: Lin, Yu-Cheng, et al.
Published: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
by: Shi, Hao, et al.
Published: (2025)
by: Shi, Hao, et al.
Published: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
by: Jie, Shibo, et al.
Published: (2024)
by: Jie, Shibo, et al.
Published: (2024)
CU-Mamba: Selective State Space Models with Channel Learning for Image Restoration
by: Deng, Rui, et al.
Published: (2024)
by: Deng, Rui, et al.
Published: (2024)
Deformba: Vision State Space Model with Adaptive State Fusion
by: Ke, Hongyu, et al.
Published: (2026)
by: Ke, Hongyu, et al.
Published: (2026)
Similar Items
-
X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning
by: Ng, Chee, et al.
Published: (2025) -
ShadowMamba: State-Space Model with Boundary-Region Selective Scan for Shadow Removal
by: Zhu, Xiujin, et al.
Published: (2024) -
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026) -
Large Language Models for Video Surveillance Applications
by: De Silva, Ulindu, et al.
Published: (2025) -
Educational Personalized Learning Path Planning with Large Language Models
by: Ng, Chee, et al.
Published: (2024)