Text-guided Visual Prompt DINO for Generic Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Guan, Yuchen, Sun, Chong, Fu, Canmiao, Huang, Zhipeng, Yuan, Chun, Li, Chen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
von: Fu, Weifu, et al.
Veröffentlicht: (2026)
von: Fu, Weifu, et al.
Veröffentlicht: (2026)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
DINO-Tok: Adapting DINO for Visual Tokenizers
von: Jia, Mingkai, et al.
Veröffentlicht: (2025)
von: Jia, Mingkai, et al.
Veröffentlicht: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
Video-GPT via Next Clip Diffusion
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
Get In Video: Add Anything You Want to the Video
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3
von: Yang, Sicheng, et al.
Veröffentlicht: (2025)
von: Yang, Sicheng, et al.
Veröffentlicht: (2025)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
von: Wang, Yuanrui, et al.
Veröffentlicht: (2025)
von: Wang, Yuanrui, et al.
Veröffentlicht: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
von: Liu, Qingyang, et al.
Veröffentlicht: (2026)
von: Liu, Qingyang, et al.
Veröffentlicht: (2026)
Unlocking Generalization in Polyp Segmentation with DINO Self-Attention "keys"
von: Monteiro, Carla, et al.
Veröffentlicht: (2025)
von: Monteiro, Carla, et al.
Veröffentlicht: (2025)
FreqDINO: Frequency-Guided Adaptation for Generalized Boundary-Aware Ultrasound Image Segmentation
von: Zhang, Yixuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yixuan, et al.
Veröffentlicht: (2025)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
von: Jiang, Dongsheng, et al.
Veröffentlicht: (2023)
von: Jiang, Dongsheng, et al.
Veröffentlicht: (2023)
Empowering DINO Representations for Underwater Instance Segmentation via Aligner and Prompter
von: Chen, Zhiyang, et al.
Veröffentlicht: (2025)
von: Chen, Zhiyang, et al.
Veröffentlicht: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
von: Guo, Pinxue, et al.
Veröffentlicht: (2024)
von: Guo, Pinxue, et al.
Veröffentlicht: (2024)
UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits
von: Ye, Keming, et al.
Veröffentlicht: (2025)
von: Ye, Keming, et al.
Veröffentlicht: (2025)
Topology-Agnostic Animal Motion Generation from Text Prompt
von: Chen, Keyi, et al.
Veröffentlicht: (2025)
von: Chen, Keyi, et al.
Veröffentlicht: (2025)
DINO-Foresight: Looking into the Future with DINO
von: Karypidis, Efstathios, et al.
Veröffentlicht: (2024)
von: Karypidis, Efstathios, et al.
Veröffentlicht: (2024)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
von: Rasaee, Hamza, et al.
Veröffentlicht: (2025)
von: Rasaee, Hamza, et al.
Veröffentlicht: (2025)
Human-Free Automated Prompting for Vision-Language Anomaly Detection: Prompt Optimization with Meta-guiding Prompt Scheme
von: Chen, Pi-Wei, et al.
Veröffentlicht: (2024)
von: Chen, Pi-Wei, et al.
Veröffentlicht: (2024)
Text-driven Multiplanar Visual Interaction for Semi-supervised Medical Image Segmentation
von: Huang, Kaiwen, et al.
Veröffentlicht: (2025)
von: Huang, Kaiwen, et al.
Veröffentlicht: (2025)
PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation
von: Rosi, Gabriele, et al.
Veröffentlicht: (2026)
von: Rosi, Gabriele, et al.
Veröffentlicht: (2026)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
von: Liang, Zhuonan, et al.
Veröffentlicht: (2026)
von: Liang, Zhuonan, et al.
Veröffentlicht: (2026)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
von: Gao, Yifan, et al.
Veröffentlicht: (2026)
von: Gao, Yifan, et al.
Veröffentlicht: (2026)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model
von: Nan, Zhixiong, et al.
Veröffentlicht: (2024)
von: Nan, Zhixiong, et al.
Veröffentlicht: (2024)
DINO-MVR: Multi-View Readout of Frozen DINOv3 for Annotation-Efficient Medical Segmentation
von: Jiang, Wei, et al.
Veröffentlicht: (2026)
von: Jiang, Wei, et al.
Veröffentlicht: (2026)
Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation
von: Lian, Sheng, et al.
Veröffentlicht: (2025)
von: Lian, Sheng, et al.
Veröffentlicht: (2025)
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing
von: Wang, Kejie, et al.
Veröffentlicht: (2024)
von: Wang, Kejie, et al.
Veröffentlicht: (2024)
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
von: Zeng, Haoxi, et al.
Veröffentlicht: (2026)
von: Zeng, Haoxi, et al.
Veröffentlicht: (2026)
Enhancing Logits Distillation with Plug\&Play Kendall's $τ$ Ranking Loss
von: Guan, Yuchen, et al.
Veröffentlicht: (2024)
von: Guan, Yuchen, et al.
Veröffentlicht: (2024)
TV-3DG: Mastering Text-to-3D Customized Generation with Visual Prompt
von: Yang, Jiahui, et al.
Veröffentlicht: (2024)
von: Yang, Jiahui, et al.
Veröffentlicht: (2024)
Evaluating Stenosis Detection with Grounding DINO, YOLO, and DINO-DETR
von: Ansari, Muhammad Musab
Veröffentlicht: (2025)
von: Ansari, Muhammad Musab
Veröffentlicht: (2025)
PixelDINO: Semi-Supervised Semantic Segmentation for Detecting Permafrost Disturbances
von: Heidler, Konrad, et al.
Veröffentlicht: (2024)
von: Heidler, Konrad, et al.
Veröffentlicht: (2024)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
von: Liu, Shilong, et al.
Veröffentlicht: (2023)
von: Liu, Shilong, et al.
Veröffentlicht: (2023)
Enhancing Label-efficient Medical Image Segmentation with Text-guided Diffusion Models
von: Feng, Chun-Mei
Veröffentlicht: (2024)
von: Feng, Chun-Mei
Veröffentlicht: (2024)
DINO-SLAM: DINO-informed RGB-D SLAM for Neural Implicit and Explicit Representations
von: Gong, Ziren, et al.
Veröffentlicht: (2025)
von: Gong, Ziren, et al.
Veröffentlicht: (2025)
Char-SAM: Turning Segment Anything Model into Scene Text Segmentation Annotator with Character-level Visual Prompts
von: Xie, Enze, et al.
Veröffentlicht: (2024)
von: Xie, Enze, et al.
Veröffentlicht: (2024)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
von: Fallah, Forouzan, et al.
Veröffentlicht: (2025)
von: Fallah, Forouzan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
von: Guo, Yiwei, et al.
Veröffentlicht: (2026) -
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
von: Fu, Weifu, et al.
Veröffentlicht: (2026) -
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025) -
DINO-Tok: Adapting DINO for Visual Tokenizers
von: Jia, Mingkai, et al.
Veröffentlicht: (2025) -
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)