Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Cho, Yubin, Yu, Hyunwoo, Kang, Suk-ju |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VIPA: Visual Informative Part Attention for Referring Image Segmentation
by: Cho, Yubin, et al.
Published: (2026)
by: Cho, Yubin, et al.
Published: (2026)
MetaSeg: MetaFormer-based Global Contexts-aware Network for Efficient Semantic Segmentation
by: Kang, Beoungwoo, et al.
Published: (2024)
by: Kang, Beoungwoo, et al.
Published: (2024)
Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic Segmentation
by: Yu, Hyunwoo, et al.
Published: (2024)
by: Yu, Hyunwoo, et al.
Published: (2024)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
by: Shen, Li-Cheng, et al.
Published: (2025)
by: Shen, Li-Cheng, et al.
Published: (2025)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
by: Li, Kevin, et al.
Published: (2025)
by: Li, Kevin, et al.
Published: (2025)
AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation
by: Chen, Tongfei, et al.
Published: (2026)
by: Chen, Tongfei, et al.
Published: (2026)
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
by: Woo, Sangmin, et al.
Published: (2024)
by: Woo, Sangmin, et al.
Published: (2024)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
by: Chen, Jiuhai, et al.
Published: (2024)
by: Chen, Jiuhai, et al.
Published: (2024)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
by: Cao, Shengcao, et al.
Published: (2025)
by: Cao, Shengcao, et al.
Published: (2025)
TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation
by: Lu, Qianqi, et al.
Published: (2025)
by: Lu, Qianqi, et al.
Published: (2025)
A Text-Image Fusion Method with Data Augmentation Capabilities for Referring Medical Image Segmentation
by: Chai, Shurong, et al.
Published: (2025)
by: Chai, Shurong, et al.
Published: (2025)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
by: Lee, Dohun, et al.
Published: (2025)
by: Lee, Dohun, et al.
Published: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
by: She, Yifei, et al.
Published: (2025)
by: She, Yifei, et al.
Published: (2025)
Uncertainty-aware Evidential Fusion-based Learning for Semi-supervised Medical Image Segmentation
by: He, Yuanpeng, et al.
Published: (2024)
by: He, Yuanpeng, et al.
Published: (2024)
Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
by: Zeng, Chengxi, et al.
Published: (2025)
by: Zeng, Chengxi, et al.
Published: (2025)
SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment
by: Lu, Wenbo
Published: (2025)
by: Lu, Wenbo
Published: (2025)
Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation
by: Dong, Zhe, et al.
Published: (2024)
by: Dong, Zhe, et al.
Published: (2024)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
by: Yang, Jiaxing, et al.
Published: (2025)
by: Yang, Jiaxing, et al.
Published: (2025)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
by: Sultan, Rafi Ibn, et al.
Published: (2025)
by: Sultan, Rafi Ibn, et al.
Published: (2025)
Latent Expression Generation for Referring Image Segmentation and Grounding
by: Yu, Seonghoon, et al.
Published: (2025)
by: Yu, Seonghoon, et al.
Published: (2025)
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Representation Separation for Semantic Segmentation with Vision Transformers
by: Hong, Yuanduo, et al.
Published: (2022)
by: Hong, Yuanduo, et al.
Published: (2022)
Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
by: Kang, Mingyu, et al.
Published: (2025)
by: Kang, Mingyu, et al.
Published: (2025)
Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
by: An, Na Min, et al.
Published: (2025)
by: An, Na Min, et al.
Published: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
by: Wang, Yizhou, et al.
Published: (2025)
by: Wang, Yizhou, et al.
Published: (2025)
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
by: Böhle, Moritz, et al.
Published: (2025)
by: Böhle, Moritz, et al.
Published: (2025)
Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding
by: Nguyen-Truong, Hai, et al.
Published: (2024)
by: Nguyen-Truong, Hai, et al.
Published: (2024)
Frequency-aware Feature Fusion for Dense Image Prediction
by: Chen, Linwei, et al.
Published: (2024)
by: Chen, Linwei, et al.
Published: (2024)
Advancing Medical Image Segmentation: Morphology-Driven Learning with Diffusion Transformer
by: Kang, Sungmin, et al.
Published: (2024)
by: Kang, Sungmin, et al.
Published: (2024)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
by: Woo, Sangmin, et al.
Published: (2024)
by: Woo, Sangmin, et al.
Published: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
by: Yao, Yuan, et al.
Published: (2026)
by: Yao, Yuan, et al.
Published: (2026)
Pseudo-RIS: Distinctive Pseudo-supervision Generation for Referring Image Segmentation
by: Yu, Seonghoon, et al.
Published: (2024)
by: Yu, Seonghoon, et al.
Published: (2024)
XAttnRes: Cross-Stage Attention Residuals for Medical Image Segmentation
by: Liu, Xinyu, et al.
Published: (2026)
by: Liu, Xinyu, et al.
Published: (2026)
GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
by: Hegde, Sandesh, et al.
Published: (2026)
by: Hegde, Sandesh, et al.
Published: (2026)
Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers
by: Tölle, Malte, et al.
Published: (2025)
by: Tölle, Malte, et al.
Published: (2025)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
by: Diao, Haiwen, et al.
Published: (2025)
by: Diao, Haiwen, et al.
Published: (2025)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
by: Feng, Wenfeng, et al.
Published: (2025)
by: Feng, Wenfeng, et al.
Published: (2025)
DescriptorMedSAM: Language-Image Fusion with Multi-Aspect Text Guidance for Medical Image Segmentation
by: Zhang, Wenjie, et al.
Published: (2025)
by: Zhang, Wenjie, et al.
Published: (2025)
PolaFormer: Polarity-aware Linear Attention for Vision Transformers
by: Meng, Weikang, et al.
Published: (2025)
by: Meng, Weikang, et al.
Published: (2025)
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024)
by: Yang, Yuhuan, et al.
Published: (2024)
Similar Items
-
VIPA: Visual Informative Part Attention for Referring Image Segmentation
by: Cho, Yubin, et al.
Published: (2026) -
MetaSeg: MetaFormer-based Global Contexts-aware Network for Efficient Semantic Segmentation
by: Kang, Beoungwoo, et al.
Published: (2024) -
Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic Segmentation
by: Yu, Hyunwoo, et al.
Published: (2024) -
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
by: Shen, Li-Cheng, et al.
Published: (2025) -
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
by: Li, Kevin, et al.
Published: (2025)