Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Dalaq, Alaa, Behzad, Muzammil
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866908378942406656
author Dalaq, Alaa
Behzad, Muzammil
author_facet Dalaq, Alaa
Behzad, Muzammil
contents Image segmentation is a fundamental task in computer vision, aimed at partitioning an image into semantically meaningful regions. Referring image segmentation extends this task by using natural language expressions to localize specific objects, requiring effective integration of visual and linguistic information. In this work, we propose SegVLM, a vision-language model that incorporates architectural improvements to enhance segmentation accuracy and cross-modal alignment. The model integrates squeeze-and-excitation (SE) blocks for dynamic feature recalibration, deformable convolutions for geometric adaptability, and residual connections for deep feature learning. We also introduce a novel referring-aware fusion (RAF) loss that balances region-level alignment, boundary precision, and class imbalance. Extensive experiments and ablation studies demonstrate that each component contributes to consistent performance improvements. SegVLM also shows strong generalization across diverse datasets and referring expression scenarios.
format Preprint
id arxiv_https___arxiv_org_abs_2505_19242
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
Dalaq, Alaa
Behzad, Muzammil
Computer Vision and Pattern Recognition
Image segmentation is a fundamental task in computer vision, aimed at partitioning an image into semantically meaningful regions. Referring image segmentation extends this task by using natural language expressions to localize specific objects, requiring effective integration of visual and linguistic information. In this work, we propose SegVLM, a vision-language model that incorporates architectural improvements to enhance segmentation accuracy and cross-modal alignment. The model integrates squeeze-and-excitation (SE) blocks for dynamic feature recalibration, deformable convolutions for geometric adaptability, and residual connections for deep feature learning. We also introduce a novel referring-aware fusion (RAF) loss that balances region-level alignment, boundary precision, and class imbalance. Extensive experiments and ablation studies demonstrate that each component contributes to consistent performance improvements. SegVLM also shows strong generalization across diverse datasets and referring expression scenarios.
title Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2505.19242