Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Dalaq, Alaa, Behzad, Muzammil |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation
by: Dalaq, Alaa, et al.
Published: (2026)
by: Dalaq, Alaa, et al.
Published: (2026)
Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025)
by: Behzad, Muzammil
Published: (2025)
Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025)
by: Behzad, Muzammil
Published: (2025)
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025)
by: Behzad, Muzammil
Published: (2025)
Contrastive Language-Image Learning with Augmented Textual Prompts for 3D/4D FER Using Vision-Language Model
by: Behzad, Muzammil, et al.
Published: (2025)
by: Behzad, Muzammil, et al.
Published: (2025)
Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement
by: Shaahid, Afrah, et al.
Published: (2025)
by: Shaahid, Afrah, et al.
Published: (2025)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
by: AlJunaid, Reem, et al.
Published: (2025)
by: AlJunaid, Reem, et al.
Published: (2025)
AquaDiff: Diffusion-Based Underwater Image Enhancement for Addressing Color Distortion
by: Shaahid, Afrah, et al.
Published: (2025)
by: Shaahid, Afrah, et al.
Published: (2025)
Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models
by: Alzubaidi, Thuraya, et al.
Published: (2025)
by: Alzubaidi, Thuraya, et al.
Published: (2025)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
by: Alzubaidi, Thuraya, et al.
Published: (2026)
by: Alzubaidi, Thuraya, et al.
Published: (2026)
Prompt-Guided Patch UNet-VAE with Adversarial Supervision for Adrenal Gland Segmentation in Computed Tomography Medical Images
by: Ghouse, Hania, et al.
Published: (2025)
by: Ghouse, Hania, et al.
Published: (2025)
MOSAIC: A Multi-View 2.5D Organ Slice Selector with Cross-Attentional Reasoning for Anatomically-Aware CT Localization in Medical Organ Segmentation
by: Ghouse, Hania, et al.
Published: (2025)
by: Ghouse, Hania, et al.
Published: (2025)
Generative Adversarial Synthesis and Deep Feature Discrimination of Brain Tumor MRI Images
by: Ali, Md Sumon, et al.
Published: (2025)
by: Ali, Md Sumon, et al.
Published: (2025)
SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation
by: Khan, Hasan Faraz, et al.
Published: (2025)
by: Khan, Hasan Faraz, et al.
Published: (2025)
From Graphs to Gates: DNS-HyXNet, A Lightweight and Deployable Sequential Model for Real-Time DNS Tunnel Detection
by: Ali, Faraz, et al.
Published: (2025)
by: Ali, Faraz, et al.
Published: (2025)
ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models
by: Aydın, M. Arda, et al.
Published: (2026)
by: Aydın, M. Arda, et al.
Published: (2026)
PULSE: A Unified Multi-Task Architecture for Cardiac Segmentation, Diagnosis, and Few-Shot Cross-Modality Clinical Adaptation
by: Ghouse, Hania, et al.
Published: (2025)
by: Ghouse, Hania, et al.
Published: (2025)
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
by: Martins, Tomas Berriel, et al.
Published: (2026)
by: Martins, Tomas Berriel, et al.
Published: (2026)
ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos
by: Ghoddoosian, Reza, et al.
Published: (2024)
by: Ghoddoosian, Reza, et al.
Published: (2024)
Attack-Aware Deepfake Detection under Counter-Forensic Manipulations
by: Fatima, Noor, et al.
Published: (2025)
by: Fatima, Noor, et al.
Published: (2025)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
by: Meng, Tian, et al.
Published: (2024)
by: Meng, Tian, et al.
Published: (2024)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
by: Sakurai, Kosuke, et al.
Published: (2025)
by: Sakurai, Kosuke, et al.
Published: (2025)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
by: Yan, Yichen, et al.
Published: (2023)
by: Yan, Yichen, et al.
Published: (2023)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
by: Wang, Zanyi, et al.
Published: (2025)
by: Wang, Zanyi, et al.
Published: (2025)
Deformable-Heatmap-Segmentation for Automobile Visual Perception
by: Jin, Hongyu
Published: (2024)
by: Jin, Hongyu
Published: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
by: Zhou, Zikun, et al.
Published: (2024)
by: Zhou, Zikun, et al.
Published: (2024)
Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models
by: Pham, Hieu Dinh Trung, et al.
Published: (2025)
by: Pham, Hieu Dinh Trung, et al.
Published: (2025)
AFRDA: Attentive Feature Refinement for Domain Adaptive Semantic Segmentation
by: Khan, Md. Al-Masrur, et al.
Published: (2025)
by: Khan, Md. Al-Masrur, et al.
Published: (2025)
Learner Attentiveness and Engagement Analysis in Online Education Using Computer Vision
by: Gogawale, Sharva, et al.
Published: (2024)
by: Gogawale, Sharva, et al.
Published: (2024)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
by: Cheng, Tianheng, et al.
Published: (2026)
by: Cheng, Tianheng, et al.
Published: (2026)
ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation
by: Bi, Hanbo, et al.
Published: (2025)
by: Bi, Hanbo, et al.
Published: (2025)
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
by: Ouyang, Ziheng, et al.
Published: (2025)
by: Ouyang, Ziheng, et al.
Published: (2025)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
by: Cao, Shengcao, et al.
Published: (2025)
by: Cao, Shengcao, et al.
Published: (2025)
Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation
by: Yan, Yichen, et al.
Published: (2024)
by: Yan, Yichen, et al.
Published: (2024)
Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment
by: Wang, Hongyi, et al.
Published: (2025)
by: Wang, Hongyi, et al.
Published: (2025)
Test-Time Hinting for Black-Box Vision-Language Models
by: Hou, Kaihua, et al.
Published: (2026)
by: Hou, Kaihua, et al.
Published: (2026)
Coding the Visual World: From Image to Simulation Using Vision Language Models
by: Eppel, Sagi
Published: (2026)
by: Eppel, Sagi
Published: (2026)
Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models
by: Barbara, Mario, et al.
Published: (2025)
by: Barbara, Mario, et al.
Published: (2025)
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
by: Lin, Weihuang, et al.
Published: (2025)
by: Lin, Weihuang, et al.
Published: (2025)
Similar Items
-
Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation
by: Dalaq, Alaa, et al.
Published: (2026) -
Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025) -
Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025) -
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025) -
Contrastive Language-Image Learning with Augmented Textual Prompts for 3D/4D FER Using Vision-Language Model
by: Behzad, Muzammil, et al.
Published: (2025)