Saved in:
| Main Authors: | Hegde, Sandesh, Chacko, Jaison Saji, Banerjee, Debarshi, Mahesh, Uma |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.09701 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling Vision-and-Language Navigation With Offline RL
by: Bundele, Valay, et al.
Published: (2024)
by: Bundele, Valay, et al.
Published: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
by: Yao, Yuan, et al.
Published: (2026)
by: Yao, Yuan, et al.
Published: (2026)
Med-DisSeg: Dispersion-Driven Representation Learning for Fine-Grained Medical Image Segmentation
by: Chen, Zhiquan, et al.
Published: (2026)
by: Chen, Zhiquan, et al.
Published: (2026)
SegMASt3R: Geometry Grounded Segment Matching
by: Jayanti, Rohit, et al.
Published: (2025)
by: Jayanti, Rohit, et al.
Published: (2025)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
by: Qian, Rui, et al.
Published: (2026)
by: Qian, Rui, et al.
Published: (2026)
DA-SegFormer: Damage-Aware Semantic Segmentation for Fine-Grained Disaster Assessment
by: Zhu, Kevin, et al.
Published: (2026)
by: Zhu, Kevin, et al.
Published: (2026)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
by: Yan, Siming, et al.
Published: (2024)
by: Yan, Siming, et al.
Published: (2024)
RSRefSeg: Referring Remote Sensing Image Segmentation with Foundation Models
by: Chen, Keyan, et al.
Published: (2025)
by: Chen, Keyan, et al.
Published: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
by: Kang, Weitai, et al.
Published: (2024)
by: Kang, Weitai, et al.
Published: (2024)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
by: Wang, Chenhao, et al.
Published: (2026)
by: Wang, Chenhao, et al.
Published: (2026)
RefineSeg: Dual Coarse-to-Fine Learning for Medical Image Segmentation
by: Du, Anghong, et al.
Published: (2025)
by: Du, Anghong, et al.
Published: (2025)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
by: Huang, Yu, et al.
Published: (2025)
by: Huang, Yu, et al.
Published: (2025)
MedSeg-R: Medical Image Segmentation with Clinical Reasoning
by: Shao, Hao, et al.
Published: (2025)
by: Shao, Hao, et al.
Published: (2025)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
by: Chen, Yule, et al.
Published: (2025)
by: Chen, Yule, et al.
Published: (2025)
SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images
by: Xin, Zepeng, et al.
Published: (2025)
by: Xin, Zepeng, et al.
Published: (2025)
Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation
by: Lei, Sen, et al.
Published: (2024)
by: Lei, Sen, et al.
Published: (2024)
Mask Grounding for Referring Image Segmentation
by: Chng, Yong Xien, et al.
Published: (2023)
by: Chng, Yong Xien, et al.
Published: (2023)
RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models
by: Chen, Keyan, et al.
Published: (2025)
by: Chen, Keyan, et al.
Published: (2025)
ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics
by: Caramia, Donato, et al.
Published: (2025)
by: Caramia, Donato, et al.
Published: (2025)
MatchSeg: Towards Better Segmentation via Reference Image Matching
by: Huo, Jiayu, et al.
Published: (2024)
by: Huo, Jiayu, et al.
Published: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
by: Shan, Haozhe, et al.
Published: (2026)
by: Shan, Haozhe, et al.
Published: (2026)
FugSeg: Fast Uncertainty-aware Ground Segmentation for 3D Point Cloud
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
by: You, Zuyao, et al.
Published: (2025)
by: You, Zuyao, et al.
Published: (2025)
Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
by: Brahma, Debarshi, et al.
Published: (2025)
by: Brahma, Debarshi, et al.
Published: (2025)
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
by: Li, Ling, et al.
Published: (2026)
by: Li, Ling, et al.
Published: (2026)
Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
by: Guo, Leilei, et al.
Published: (2025)
by: Guo, Leilei, et al.
Published: (2025)
FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis
by: Gavas, Ekta, et al.
Published: (2025)
by: Gavas, Ekta, et al.
Published: (2025)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
by: Sakurai, Kosuke, et al.
Published: (2025)
by: Sakurai, Kosuke, et al.
Published: (2025)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
by: Yan, Yichen, et al.
Published: (2023)
by: Yan, Yichen, et al.
Published: (2023)
MetaSegNet: Metadata-collaborative Vision-Language Representation Learning for Semantic Segmentation of Remote Sensing Images
by: Wang, Libo, et al.
Published: (2023)
by: Wang, Libo, et al.
Published: (2023)
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
by: Deng, Xueqing, et al.
Published: (2025)
by: Deng, Xueqing, et al.
Published: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
FILA: Fine-Grained Vision Language Models
by: Zhu, Shiding, et al.
Published: (2024)
by: Zhu, Shiding, et al.
Published: (2024)
ACS-SegNet: An Attention-Based CNN-SegFormer Segmentation Network for Tissue Segmentation in Histopathology
by: Torbati, Nima, et al.
Published: (2025)
by: Torbati, Nima, et al.
Published: (2025)
SliceLens: Fine-Grained and Grounded Error Slice Discovery for Multi-Instance Vision Tasks
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Towards Fine-grained Renal Vasculature Segmentation: Full-Scale Hierarchical Learning with FH-Seg
by: Long, Yitian, et al.
Published: (2025)
by: Long, Yitian, et al.
Published: (2025)
CADFormer: Fine-Grained Cross-modal Alignment and Decoding Transformer for Referring Remote Sensing Image Segmentation
by: Liu, Maofu, et al.
Published: (2025)
by: Liu, Maofu, et al.
Published: (2025)
MitoSeg: Mitochondria Segmentation Tool
by: Taşel, Faris Serdar, et al.
Published: (2024)
by: Taşel, Faris Serdar, et al.
Published: (2024)
SegSLR: Promptable Video Segmentation for Isolated Sign Language Recognition
by: Schreiber, Sven, et al.
Published: (2025)
by: Schreiber, Sven, et al.
Published: (2025)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
by: Wei, Cong, et al.
Published: (2024)
by: Wei, Cong, et al.
Published: (2024)
Similar Items
-
Scaling Vision-and-Language Navigation With Offline RL
by: Bundele, Valay, et al.
Published: (2024) -
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
by: Yao, Yuan, et al.
Published: (2026) -
Med-DisSeg: Dispersion-Driven Representation Learning for Fine-Grained Medical Image Segmentation
by: Chen, Zhiquan, et al.
Published: (2026) -
SegMASt3R: Geometry Grounded Segment Matching
by: Jayanti, Rohit, et al.
Published: (2025) -
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
by: Qian, Rui, et al.
Published: (2026)