SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Mao, Zhenjie, Yang, Yuhuan, Ma, Chaofan, Jiang, Dongsheng, Yao, Jiangchao, Zhang, Ya, Wang, Yanfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReMamber: Referring Image Segmentation with Mamba Twister
por: Yang, Yuhuan, et al.
Publicado: (2024)
por: Yang, Yuhuan, et al.
Publicado: (2024)
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
por: Yang, Yuhuan, et al.
Publicado: (2025)
por: Yang, Yuhuan, et al.
Publicado: (2025)
Multi-Modal Prototypes for Open-World Semantic Segmentation
por: Yang, Yuhuan, et al.
Publicado: (2023)
por: Yang, Yuhuan, et al.
Publicado: (2023)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
por: Yang, Yuhuan, et al.
Publicado: (2026)
por: Yang, Yuhuan, et al.
Publicado: (2026)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
por: Ma, Chaofan, et al.
Publicado: (2023)
por: Ma, Chaofan, et al.
Publicado: (2023)
Zero-shot Composed Text-Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2023)
por: Liu, Yikun, et al.
Publicado: (2023)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
por: Zhang, Tianjiao, et al.
Publicado: (2025)
por: Zhang, Tianjiao, et al.
Publicado: (2025)
A Sanity Check on Composed Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2026)
por: Liu, Yikun, et al.
Publicado: (2026)
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
por: Zhang, Ruipeng, et al.
Publicado: (2024)
por: Zhang, Ruipeng, et al.
Publicado: (2024)
Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data
por: Hong, Feng, et al.
Publicado: (2025)
por: Hong, Feng, et al.
Publicado: (2025)
Emergence of Fixational and Saccadic Movements in a Multi-Level Recurrent Attention Model for Vision
por: Pan, Pengcheng, et al.
Publicado: (2025)
por: Pan, Pengcheng, et al.
Publicado: (2025)
Reprogramming Distillation for Medical Foundation Models
por: Zhou, Yuhang, et al.
Publicado: (2024)
por: Zhou, Yuhang, et al.
Publicado: (2024)
Low-Rank Knowledge Decomposition for Medical Foundation Models
por: Zhou, Yuhang, et al.
Publicado: (2024)
por: Zhou, Yuhang, et al.
Publicado: (2024)
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
por: Fang, Yushun, et al.
Publicado: (2025)
por: Fang, Yushun, et al.
Publicado: (2025)
SaccadeDet: A Novel Dual-Stage Architecture for Rapid and Accurate Detection in Gigapixel Images
por: Li, Wenxi, et al.
Publicado: (2024)
por: Li, Wenxi, et al.
Publicado: (2024)
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
por: Dai, Tianjie, et al.
Publicado: (2023)
por: Dai, Tianjie, et al.
Publicado: (2023)
Learning to Instruct for Visual Instruction Tuning
por: Zhou, Zhihan, et al.
Publicado: (2025)
por: Zhou, Zhihan, et al.
Publicado: (2025)
CroBIM-U: Uncertainty-Driven Referring Remote Sensing Image Segmentation
por: Sun, Yuzhe, et al.
Publicado: (2026)
por: Sun, Yuzhe, et al.
Publicado: (2026)
Exploring Training on Heterogeneous Data with Mixture of Low-rank Adapters
por: Zhou, Yuhang, et al.
Publicado: (2024)
por: Zhou, Yuhang, et al.
Publicado: (2024)
Mitigating Noisy Correspondence by Geometrical Structure Consistency Learning
por: Zhao, Zihua, et al.
Publicado: (2024)
por: Zhao, Zihua, et al.
Publicado: (2024)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
por: Zhang, Fei, et al.
Publicado: (2025)
por: Zhang, Fei, et al.
Publicado: (2025)
Spiking Vision Transformer with Saccadic Attention
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
WDFFU-Mamba: A Wavelet-guided Dual-attention Feature Fusion Mamba for Breast Tumor Segmentation in Ultrasound Images
por: Cai, Guoping, et al.
Publicado: (2025)
por: Cai, Guoping, et al.
Publicado: (2025)
Prior-Guided Residual Diffusion: Calibrated and Efficient Medical Image Segmentation
por: Mao, Fuyou, et al.
Publicado: (2025)
por: Mao, Fuyou, et al.
Publicado: (2025)
ViFi-ReID: A Two-Stream Vision-WiFi Multimodal Approach for Person Re-identification
por: Mao, Chen, et al.
Publicado: (2024)
por: Mao, Chen, et al.
Publicado: (2024)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
por: Li, Haolin, et al.
Publicado: (2024)
por: Li, Haolin, et al.
Publicado: (2024)
Deep Reprogramming Distillation for Medical Foundation Models
por: Du, Siyuan, et al.
Publicado: (2026)
por: Du, Siyuan, et al.
Publicado: (2026)
Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track
por: Hong, Ran, et al.
Publicado: (2025)
por: Hong, Ran, et al.
Publicado: (2025)
TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation
por: Yang, Haoyu, et al.
Publicado: (2025)
por: Yang, Haoyu, et al.
Publicado: (2025)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
por: Liu, Yikun, et al.
Publicado: (2024)
por: Liu, Yikun, et al.
Publicado: (2024)
MambaMIM: Pre-training Mamba with State Space Token Interpolation and its Application to Medical Image Segmentation
por: Tang, Fenghe, et al.
Publicado: (2024)
por: Tang, Fenghe, et al.
Publicado: (2024)
DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models
por: Dong, Zhe, et al.
Publicado: (2025)
por: Dong, Zhe, et al.
Publicado: (2025)
ShapeMamba-EM: Fine-Tuning Foundation Model with Local Shape Descriptors and Mamba Blocks for 3D EM Image Segmentation
por: Shi, Ruohua, et al.
Publicado: (2024)
por: Shi, Ruohua, et al.
Publicado: (2024)
Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation
por: Dong, Zhe, et al.
Publicado: (2024)
por: Dong, Zhe, et al.
Publicado: (2024)
Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation
por: Yang, Xiaobo, et al.
Publicado: (2025)
por: Yang, Xiaobo, et al.
Publicado: (2025)
A Saccade-inspired Approach to Image Classification using Vision Transformer Attention Maps
por: Dallain, Matthis, et al.
Publicado: (2026)
por: Dallain, Matthis, et al.
Publicado: (2026)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Differential-informed Sample Selection Accelerates Multimodal Contrastive Learning
por: Zhao, Zihua, et al.
Publicado: (2025)
por: Zhao, Zihua, et al.
Publicado: (2025)
RIS-FUSION: Rethinking Text-Driven Infrared and Visible Image Fusion from the Perspective of Referring Image Segmentation
por: Ma, Siju, et al.
Publicado: (2025)
por: Ma, Siju, et al.
Publicado: (2025)
SegMamba: Long-range Sequential Modeling Mamba For 3D Medical Image Segmentation
por: Xing, Zhaohu, et al.
Publicado: (2024)
por: Xing, Zhaohu, et al.
Publicado: (2024)
Ejemplares similares
-
ReMamber: Referring Image Segmentation with Mamba Twister
por: Yang, Yuhuan, et al.
Publicado: (2024) -
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
por: Yang, Yuhuan, et al.
Publicado: (2025) -
Multi-Modal Prototypes for Open-World Semantic Segmentation
por: Yang, Yuhuan, et al.
Publicado: (2023) -
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
por: Yang, Yuhuan, et al.
Publicado: (2026) -
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
por: Ma, Chaofan, et al.
Publicado: (2023)