iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Lin, Cao, Jiale, Xie, Jin, Khan, Fahad Shahbaz, Pang, Yanwei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation
by: Xie, Bin, et al.
Published: (2023)
by: Xie, Bin, et al.
Published: (2023)
iSeg: Interactive 3D Segmentation via Interactive Attention
by: Lang, Itai, et al.
Published: (2024)
by: Lang, Itai, et al.
Published: (2024)
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation
by: Sun, Lin, et al.
Published: (2024)
by: Sun, Lin, et al.
Published: (2024)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
by: Zhu, Wenqi, et al.
Published: (2024)
by: Zhu, Wenqi, et al.
Published: (2024)
Transformer-based stereo-aware 3D object detection from binocular images
by: Sun, Hanqing, et al.
Published: (2023)
by: Sun, Hanqing, et al.
Published: (2023)
Implicit and Explicit Language Guidance for Diffusion-based Visual Perception
by: Wang, Hefeng, et al.
Published: (2024)
by: Wang, Hefeng, et al.
Published: (2024)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
by: Li, Yuhao, et al.
Published: (2024)
by: Li, Yuhao, et al.
Published: (2024)
DB-SAM: Delving into High Quality Universal Medical Image Segmentation
by: Qin, Chao, et al.
Published: (2024)
by: Qin, Chao, et al.
Published: (2024)
SNNSIR: A Simple Spiking Neural Network for Stereo Image Restoration
by: Xu, Ronghua, et al.
Published: (2025)
by: Xu, Ronghua, et al.
Published: (2025)
Language Guided Domain Generalized Medical Image Segmentation
by: Kunhimon, Shahina, et al.
Published: (2024)
by: Kunhimon, Shahina, et al.
Published: (2024)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
by: Ding, Bonan, et al.
Published: (2026)
by: Ding, Bonan, et al.
Published: (2026)
LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
by: Yan, Xinyu, et al.
Published: (2025)
by: Yan, Xinyu, et al.
Published: (2025)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
by: Dharmasiri, Amaya, et al.
Published: (2024)
by: Dharmasiri, Amaya, et al.
Published: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
by: Munasinghe, Shehan, et al.
Published: (2024)
by: Munasinghe, Shehan, et al.
Published: (2024)
VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection
by: Ding, Bonan, et al.
Published: (2024)
by: Ding, Bonan, et al.
Published: (2024)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
by: Luo, Ziyang, et al.
Published: (2025)
by: Luo, Ziyang, et al.
Published: (2025)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
by: Demidov, Dmitry, et al.
Published: (2025)
by: Demidov, Dmitry, et al.
Published: (2025)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
by: Malik, Hashmat Shadab, et al.
Published: (2025)
by: Malik, Hashmat Shadab, et al.
Published: (2025)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
by: Mahmood, Ahmad, et al.
Published: (2024)
by: Mahmood, Ahmad, et al.
Published: (2024)
Mask Factory: Towards High-quality Synthetic Data Generation for Dichotomous Image Segmentation
by: Qian, Haotian, et al.
Published: (2024)
by: Qian, Haotian, et al.
Published: (2024)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
by: Shaker, Abdelrahman, et al.
Published: (2022)
by: Shaker, Abdelrahman, et al.
Published: (2022)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
by: Chen, Shiming, et al.
Published: (2025)
by: Chen, Shiming, et al.
Published: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
by: Maaz, Muhammad, et al.
Published: (2023)
by: Maaz, Muhammad, et al.
Published: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
by: Maaz, Muhammad, et al.
Published: (2025)
by: Maaz, Muhammad, et al.
Published: (2025)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
by: Shaker, Abdelrahman, et al.
Published: (2024)
by: Shaker, Abdelrahman, et al.
Published: (2024)
Deep Intra-Image Contrastive Learning for Weakly Supervised One-Step Person Search
by: Wang, Jiabei, et al.
Published: (2023)
by: Wang, Jiabei, et al.
Published: (2023)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
by: Kunhimon, Shahina, et al.
Published: (2023)
by: Kunhimon, Shahina, et al.
Published: (2023)
OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning
by: Han, Zongyan, et al.
Published: (2025)
by: Han, Zongyan, et al.
Published: (2025)
RefineSeg: Dual Coarse-to-Fine Learning for Medical Image Segmentation
by: Du, Anghong, et al.
Published: (2025)
by: Du, Anghong, et al.
Published: (2025)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
by: Dong, Jiahua, et al.
Published: (2025)
by: Dong, Jiahua, et al.
Published: (2025)
Towards Evaluating the Robustness of Visual State Space Models
by: Malik, Hashmat Shadab, et al.
Published: (2024)
by: Malik, Hashmat Shadab, et al.
Published: (2024)
BiCoR-Seg: Bidirectional Co-Refinement Framework for High-Resolution Remote Sensing Image Segmentation
by: Shi, Jinghao, et al.
Published: (2025)
by: Shi, Jinghao, et al.
Published: (2025)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
by: Luo, Ziyang, et al.
Published: (2025)
by: Luo, Ziyang, et al.
Published: (2025)
iSegMan: Interactive Segment-and-Manipulate 3D Gaussians
by: Zhao, Yian, et al.
Published: (2025)
by: Zhao, Yian, et al.
Published: (2025)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
by: Bharadwaj, Rohit, et al.
Published: (2024)
by: Bharadwaj, Rohit, et al.
Published: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
by: Noman, Mubashir, et al.
Published: (2024)
by: Noman, Mubashir, et al.
Published: (2024)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
by: Chen, Shiming, et al.
Published: (2025)
by: Chen, Shiming, et al.
Published: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
by: Chen, Shiming, et al.
Published: (2024)
by: Chen, Shiming, et al.
Published: (2024)
WOW-Seg: A Word-free Open World Segmentation Model
by: Li, Danyang, et al.
Published: (2026)
by: Li, Danyang, et al.
Published: (2026)
SegRAG: Training-Free Retrieval-Augmented Semantic Segmentation
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
Similar Items
-
SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation
by: Xie, Bin, et al.
Published: (2023) -
iSeg: Interactive 3D Segmentation via Interactive Attention
by: Lang, Itai, et al.
Published: (2024) -
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation
by: Sun, Lin, et al.
Published: (2024) -
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
by: Zhu, Wenqi, et al.
Published: (2024) -
Transformer-based stereo-aware 3D object detection from binocular images
by: Sun, Hanqing, et al.
Published: (2023)