EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Yichen, He, Xingjian, Wang, Wenxuan, Chen, Sihan, Liu, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2024)
di: Yan, Yichen, et al.
Pubblicazione: (2024)
Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2024)
di: Yan, Yichen, et al.
Pubblicazione: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
di: Liu, Jing, et al.
Pubblicazione: (2025)
di: Liu, Jing, et al.
Pubblicazione: (2025)
Fully Aligned Network for Referring Image Segmentation
di: Liu, Yong, et al.
Pubblicazione: (2024)
di: Liu, Yong, et al.
Pubblicazione: (2024)
Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation
di: Ren, Biaoyu, et al.
Pubblicazione: (2026)
di: Ren, Biaoyu, et al.
Pubblicazione: (2026)
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
di: Liu, Sihan, et al.
Pubblicazione: (2023)
di: Liu, Sihan, et al.
Pubblicazione: (2023)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
di: Liu, Jing, et al.
Pubblicazione: (2023)
di: Liu, Jing, et al.
Pubblicazione: (2023)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
di: Zhu, Junyou, et al.
Pubblicazione: (2024)
di: Zhu, Junyou, et al.
Pubblicazione: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
di: Yadav, Ankit, et al.
Pubblicazione: (2025)
di: Yadav, Ankit, et al.
Pubblicazione: (2025)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
di: Sakurai, Kosuke, et al.
Pubblicazione: (2025)
di: Sakurai, Kosuke, et al.
Pubblicazione: (2025)
HARIS: Human-Like Attention for Reference Image Segmentation
di: Zhang, Mengxi, et al.
Pubblicazione: (2024)
di: Zhang, Mengxi, et al.
Pubblicazione: (2024)
Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation
di: He, Jingxuan, et al.
Pubblicazione: (2026)
di: He, Jingxuan, et al.
Pubblicazione: (2026)
Robot Manipulation in Salient Vision through Referring Image Segmentation and Geometric Constraints
di: Jiang, Chen, et al.
Pubblicazione: (2024)
di: Jiang, Chen, et al.
Pubblicazione: (2024)
Image Difference Grounding with Natural Language
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition
di: He, Yuchen, et al.
Pubblicazione: (2026)
di: He, Yuchen, et al.
Pubblicazione: (2026)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
Med-Tuning: A New Parameter-Efficient Tuning Framework for Medical Volumetric Segmentation
di: Shen, Jiachen, et al.
Pubblicazione: (2023)
di: Shen, Jiachen, et al.
Pubblicazione: (2023)
2nd Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation
di: Lu, Qianqi, et al.
Pubblicazione: (2025)
di: Lu, Qianqi, et al.
Pubblicazione: (2025)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
Omni-Referring Image Segmentation
di: Zheng, Qiancheng, et al.
Pubblicazione: (2025)
di: Zheng, Qiancheng, et al.
Pubblicazione: (2025)
See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis
di: Jin, Ruinan, et al.
Pubblicazione: (2025)
di: Jin, Ruinan, et al.
Pubblicazione: (2025)
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
di: Dalaq, Alaa, et al.
Pubblicazione: (2025)
di: Dalaq, Alaa, et al.
Pubblicazione: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
di: Liu, Qihao, et al.
Pubblicazione: (2025)
di: Liu, Qihao, et al.
Pubblicazione: (2025)
RSRefSeg: Referring Remote Sensing Image Segmentation with Foundation Models
di: Chen, Keyan, et al.
Pubblicazione: (2025)
di: Chen, Keyan, et al.
Pubblicazione: (2025)
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation
di: Li, Shuyang, et al.
Pubblicazione: (2025)
di: Li, Shuyang, et al.
Pubblicazione: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
Mask Grounding for Referring Image Segmentation
di: Chng, Yong Xien, et al.
Pubblicazione: (2023)
di: Chng, Yong Xien, et al.
Pubblicazione: (2023)
VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
di: Sargent, Kyle, et al.
Pubblicazione: (2025)
di: Sargent, Kyle, et al.
Pubblicazione: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
di: Lei, Zixing, et al.
Pubblicazione: (2026)
di: Lei, Zixing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2024) -
Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2024) -
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023) -
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)