Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Ren, Tianhe, Jiang, Qing, Liu, Shilong, Zeng, Zhaoyang, Liu, Wenlong, Gao, Han, Huang, Hongjie, Ma, Zhengyu, Jiang, Xiaoke, Chen, Yihao, Xiong, Yuda, Zhang, Hao, Li, Feng, Tang, Peijun, Yu, Kent, Zhang, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
por: Ren, Tianhe, et al.
Publicado: (2024)
por: Ren, Tianhe, et al.
Publicado: (2024)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
por: Liu, Shilong, et al.
Publicado: (2023)
por: Liu, Shilong, et al.
Publicado: (2023)
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
por: Jiang, Qing, et al.
Publicado: (2024)
por: Jiang, Qing, et al.
Publicado: (2024)
Referring to Any Person
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
por: Jiang, Qing, et al.
Publicado: (2024)
por: Jiang, Qing, et al.
Publicado: (2024)
Detect Anything via Next Point Prediction
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features
por: Qu, Jinyuan, et al.
Publicado: (2025)
por: Qu, Jinyuan, et al.
Publicado: (2025)
Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
por: Ren, Tianhe, et al.
Publicado: (2024)
por: Ren, Tianhe, et al.
Publicado: (2024)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
por: Qu, Jinyuan, et al.
Publicado: (2024)
por: Qu, Jinyuan, et al.
Publicado: (2024)
TAPTR: Tracking Any Point with Transformers as Detection
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
por: Zeng, Haoxi, et al.
Publicado: (2026)
por: Zeng, Haoxi, et al.
Publicado: (2026)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection
por: Cao, Guiping, et al.
Publicado: (2025)
por: Cao, Guiping, et al.
Publicado: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
por: Wasim, Syed Talal, et al.
Publicado: (2023)
por: Wasim, Syed Talal, et al.
Publicado: (2023)
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
por: Fu, Weifu, et al.
Publicado: (2026)
por: Fu, Weifu, et al.
Publicado: (2026)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
por: Jiang, Dongsheng, et al.
Publicado: (2023)
por: Jiang, Dongsheng, et al.
Publicado: (2023)
Evaluating Stenosis Detection with Grounding DINO, YOLO, and DINO-DETR
por: Ansari, Muhammad Musab
Publicado: (2025)
por: Ansari, Muhammad Musab
Publicado: (2025)
Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection
por: Lu, Yehao, et al.
Publicado: (2025)
por: Lu, Yehao, et al.
Publicado: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
por: Ling, Yiran, et al.
Publicado: (2026)
por: Ling, Yiran, et al.
Publicado: (2026)
DIVE: Taming DINO for Subject-Driven Video Editing
por: Huang, Yi, et al.
Publicado: (2024)
por: Huang, Yi, et al.
Publicado: (2024)
A Reconstruction of the Neutrino Nature and a Unified Explanation of Related Puzzles Based on the Great Tao Model
por: Zeng, Jiqing, et al.
Publicado: (2026)
por: Zeng, Jiqing, et al.
Publicado: (2026)
The Existence Field Theory of the Great Tao Model: Establishment of the Vacuum-Medium Unified Field Equations
por: Zeng, Jiqing, et al.
Publicado: (2026)
por: Zeng, Jiqing, et al.
Publicado: (2026)
Eating Smart: Advancing Health Informatics with the Grounding DINO based Dietary Assistant App
por: Nossair, Abdelilah, et al.
Publicado: (2024)
por: Nossair, Abdelilah, et al.
Publicado: (2024)
Deploy DINO with Many-to-Many Association
por: Jiang, Haodong, et al.
Publicado: (2026)
por: Jiang, Haodong, et al.
Publicado: (2026)
AD-DINO: Attention-Dynamic DINO for Distance-Aware Embodied Reference Understanding
por: Guo, Hao, et al.
Publicado: (2024)
por: Guo, Hao, et al.
Publicado: (2024)
Weak Dual Drazin Inverse and its Characterizations and Properties
por: Wang, Hongxing, et al.
Publicado: (2024)
por: Wang, Hongxing, et al.
Publicado: (2024)
DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval
por: He, Xinwei, et al.
Publicado: (2026)
por: He, Xinwei, et al.
Publicado: (2026)
Discrimination-free Insurance Pricing with Privatized Sensitive Attributes
por: Zhang, Tianhe, et al.
Publicado: (2025)
por: Zhang, Tianhe, et al.
Publicado: (2025)
Few-Shot Adaptation of Grounding DINO for Agricultural Domain
por: Singh, Rajhans, et al.
Publicado: (2025)
por: Singh, Rajhans, et al.
Publicado: (2025)
More Pictures Say More: Visual Intersection Network for Open Set Object Detection
por: Dong, Bingcheng, et al.
Publicado: (2024)
por: Dong, Bingcheng, et al.
Publicado: (2024)
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
por: Wang, Zanyi, et al.
Publicado: (2026)
por: Wang, Zanyi, et al.
Publicado: (2026)
OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models
por: Kuang, Yuxuan, et al.
Publicado: (2024)
por: Kuang, Yuxuan, et al.
Publicado: (2024)
DINO-MVR: Multi-View Readout of Frozen DINOv3 for Annotation-Efficient Medical Segmentation
por: Jiang, Wei, et al.
Publicado: (2026)
por: Jiang, Wei, et al.
Publicado: (2026)
OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector
por: Fu, Yuqian, et al.
Publicado: (2024)
por: Fu, Yuqian, et al.
Publicado: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
por: Jia, Mingkai, et al.
Publicado: (2025)
por: Jia, Mingkai, et al.
Publicado: (2025)
DINO-SD: Champion Solution for ICRA 2024 RoboDepth Challenge
por: Mao, Yifan, et al.
Publicado: (2024)
por: Mao, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
por: Ren, Tianhe, et al.
Publicado: (2024) -
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
por: Liu, Shilong, et al.
Publicado: (2023) -
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
por: Jiang, Qing, et al.
Publicado: (2024) -
Referring to Any Person
por: Jiang, Qing, et al.
Publicado: (2025) -
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
por: Jiang, Qing, et al.
Publicado: (2024)