OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Haoxi, Liu, Qiankun, Bin, Yi, Zhang, Haiyue, Ding, Yujuan, Wang, Guoqing, Ouyang, Deqiang, Shen, Heng Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
DINO Soars: DINOv3 for Open-Vocabulary Semantic Segmentation of Remote Sensing Imagery
par: Faulkenberry, Ryan, et autres
Publié: (2026)
par: Faulkenberry, Ryan, et autres
Publié: (2026)
OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
par: Fu, Weifu, et autres
Publié: (2026)
par: Fu, Weifu, et autres
Publié: (2026)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
par: Liu, Shilong, et autres
Publié: (2023)
par: Liu, Shilong, et autres
Publié: (2023)
DINO-Foresight: Looking into the Future with DINO
par: Karypidis, Efstathios, et autres
Publié: (2024)
par: Karypidis, Efstathios, et autres
Publié: (2024)
OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation
par: Hwang, Dongjun, et autres
Publié: (2024)
par: Hwang, Dongjun, et autres
Publié: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
par: Jia, Mingkai, et autres
Publié: (2025)
par: Jia, Mingkai, et autres
Publié: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3
par: Yang, Sicheng, et autres
Publié: (2025)
par: Yang, Sicheng, et autres
Publié: (2025)
AD-DINO: Attention-Dynamic DINO for Distance-Aware Embodied Reference Understanding
par: Guo, Hao, et autres
Publié: (2024)
par: Guo, Hao, et autres
Publié: (2024)
Evaluating Stenosis Detection with Grounding DINO, YOLO, and DINO-DETR
par: Ansari, Muhammad Musab
Publié: (2025)
par: Ansari, Muhammad Musab
Publié: (2025)
Deformable One-shot Face Stylization via DINO Semantic Guidance
par: Zhou, Yang, et autres
Publié: (2024)
par: Zhou, Yang, et autres
Publié: (2024)
OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model
par: Zhang, Kunshen
Publié: (2025)
par: Zhang, Kunshen
Publié: (2025)
Simplifying DINO via Coding Rate Regularization
par: Wu, Ziyang, et autres
Publié: (2025)
par: Wu, Ziyang, et autres
Publié: (2025)
DINO-AD: Unsupervised Anomaly Detection with Frozen DINO-V3 Features
par: Huo, Jiayu, et autres
Publié: (2026)
par: Huo, Jiayu, et autres
Publié: (2026)
Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection
par: Lu, Yehao, et autres
Publié: (2025)
par: Lu, Yehao, et autres
Publié: (2025)
Text-guided Visual Prompt DINO for Generic Segmentation
par: Guan, Yuchen, et autres
Publié: (2025)
par: Guan, Yuchen, et autres
Publié: (2025)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
par: Rasaee, Hamza, et autres
Publié: (2025)
par: Rasaee, Hamza, et autres
Publié: (2025)
Empowering DINO Representations for Underwater Instance Segmentation via Aligner and Prompter
par: Chen, Zhiyang, et autres
Publié: (2025)
par: Chen, Zhiyang, et autres
Publié: (2025)
GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation
par: Dou, Weijia, et autres
Publié: (2025)
par: Dou, Weijia, et autres
Publié: (2025)
DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video
par: Tumanyan, Narek, et autres
Publié: (2024)
par: Tumanyan, Narek, et autres
Publié: (2024)
DINO-SLAM: DINO-informed RGB-D SLAM for Neural Implicit and Explicit Representations
par: Gong, Ziren, et autres
Publié: (2025)
par: Gong, Ziren, et autres
Publié: (2025)
DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model
par: Nan, Zhixiong, et autres
Publié: (2024)
par: Nan, Zhixiong, et autres
Publié: (2024)
CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection
par: Sun, Zhichao, et autres
Publié: (2025)
par: Sun, Zhichao, et autres
Publié: (2025)
Unlocking Generalization in Polyp Segmentation with DINO Self-Attention "keys"
par: Monteiro, Carla, et autres
Publié: (2025)
par: Monteiro, Carla, et autres
Publié: (2025)
Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection
par: Ren, Tianhe, et autres
Publié: (2024)
par: Ren, Tianhe, et autres
Publié: (2024)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
par: Ren, Tianhe, et autres
Publié: (2024)
par: Ren, Tianhe, et autres
Publié: (2024)
Deploy DINO with Many-to-Many Association
par: Jiang, Haodong, et autres
Publié: (2026)
par: Jiang, Haodong, et autres
Publié: (2026)
DINO-LG: Enhancing Vision Transformers with Label Guidance for Coronary Artery Calcium Detection
par: Gokmen, Mahmut S., et autres
Publié: (2024)
par: Gokmen, Mahmut S., et autres
Publié: (2024)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
par: Liang, Zhuonan, et autres
Publié: (2026)
par: Liang, Zhuonan, et autres
Publié: (2026)
PixelDINO: Semi-Supervised Semantic Segmentation for Detecting Permafrost Disturbances
par: Heidler, Konrad, et autres
Publié: (2024)
par: Heidler, Konrad, et autres
Publié: (2024)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
par: Zeng, Haoxi, et autres
Publié: (2025)
par: Zeng, Haoxi, et autres
Publié: (2025)
DIVE: Taming DINO for Subject-Driven Video Editing
par: Huang, Yi, et autres
Publié: (2024)
par: Huang, Yi, et autres
Publié: (2024)
SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM
par: Chen, Lin, et autres
Publié: (2025)
par: Chen, Lin, et autres
Publié: (2025)
DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation
par: Knaebel, Karim, et autres
Publié: (2025)
par: Knaebel, Karim, et autres
Publié: (2025)
ChangeDINO: DINOv3-Driven Building Change Detection in Optical Remote Sensing Imagery
par: Cheng, Ching-Heng, et autres
Publié: (2025)
par: Cheng, Ching-Heng, et autres
Publié: (2025)
Data or Language Supervision: What Makes CLIP Better than DINO?
par: Liu, Yiming, et autres
Publié: (2025)
par: Liu, Yiming, et autres
Publié: (2025)
Documents similaires
-
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
par: Barsellotti, Luca, et autres
Publié: (2024) -
DINO Soars: DINOv3 for Open-Vocabulary Semantic Segmentation of Remote Sensing Imagery
par: Faulkenberry, Ryan, et autres
Publié: (2026) -
OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion
par: Wang, Hao, et autres
Publié: (2024) -
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
par: Fu, Weifu, et autres
Publié: (2026) -
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
par: Liu, Shilong, et autres
Publié: (2023)