Salvato in:
| Autori principali: | Wu, Ziyang, Zhang, Jingyuan, Pai, Druv, Wang, XuDong, Singh, Chandan, Yang, Jianwei, Gao, Jianfeng, Ma, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.10385 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
White-Box Transformers via Sparse Rate Reduction: Compression Is All There Is?
di: Yu, Yaodong, et al.
Pubblicazione: (2023)
di: Yu, Yaodong, et al.
Pubblicazione: (2023)
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
DINO-AD: Unsupervised Anomaly Detection with Frozen DINO-V3 Features
di: Huo, Jiayu, et al.
Pubblicazione: (2026)
di: Huo, Jiayu, et al.
Pubblicazione: (2026)
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
di: Liu, Shilong, et al.
Pubblicazione: (2023)
di: Liu, Shilong, et al.
Pubblicazione: (2023)
Towards Understanding Graphical Perception in Large Multimodal Models
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
Pix2Gif: Motion-Guided Diffusion for GIF Generation
di: Kandala, Hitesh, et al.
Pubblicazione: (2024)
di: Kandala, Hitesh, et al.
Pubblicazione: (2024)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
di: Yu, Junwei, et al.
Pubblicazione: (2025)
di: Yu, Junwei, et al.
Pubblicazione: (2025)
DINO-Foresight: Looking into the Future with DINO
di: Karypidis, Efstathios, et al.
Pubblicazione: (2024)
di: Karypidis, Efstathios, et al.
Pubblicazione: (2024)
AD-DINO: Attention-Dynamic DINO for Distance-Aware Embodied Reference Understanding
di: Guo, Hao, et al.
Pubblicazione: (2024)
di: Guo, Hao, et al.
Pubblicazione: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
DINO-BOLDNet: A DINOv3-Guided Multi-Slice Attention Network for T1-to-BOLD Generation
di: Wang, Jianwei, et al.
Pubblicazione: (2025)
di: Wang, Jianwei, et al.
Pubblicazione: (2025)
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
di: Fu, Weifu, et al.
Pubblicazione: (2026)
di: Fu, Weifu, et al.
Pubblicazione: (2026)
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
di: Zeng, Haoxi, et al.
Pubblicazione: (2026)
di: Zeng, Haoxi, et al.
Pubblicazione: (2026)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
DINO-SLAM: DINO-informed RGB-D SLAM for Neural Implicit and Explicit Representations
di: Gong, Ziren, et al.
Pubblicazione: (2025)
di: Gong, Ziren, et al.
Pubblicazione: (2025)
SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
Evaluating Stenosis Detection with Grounding DINO, YOLO, and DINO-DETR
di: Ansari, Muhammad Musab
Pubblicazione: (2025)
di: Ansari, Muhammad Musab
Pubblicazione: (2025)
CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection
di: Sun, Zhichao, et al.
Pubblicazione: (2025)
di: Sun, Zhichao, et al.
Pubblicazione: (2025)
Deploy DINO with Many-to-Many Association
di: Jiang, Haodong, et al.
Pubblicazione: (2026)
di: Jiang, Haodong, et al.
Pubblicazione: (2026)
Few-Shot Adaptation of Grounding DINO for Agricultural Domain
di: Singh, Rajhans, et al.
Pubblicazione: (2025)
di: Singh, Rajhans, et al.
Pubblicazione: (2025)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
Deformable One-shot Face Stylization via DINO Semantic Guidance
di: Zhou, Yang, et al.
Pubblicazione: (2024)
di: Zhou, Yang, et al.
Pubblicazione: (2024)
DINO-VO: Learning Where to Focus for Enhanced State Estimation
di: Chen, Qi, et al.
Pubblicazione: (2026)
di: Chen, Qi, et al.
Pubblicazione: (2026)
DINO-Explorer: Active Underwater Discovery via Ego-Motion Compensated Semantic Predictive Coding
di: Jin, Yuhan, et al.
Pubblicazione: (2026)
di: Jin, Yuhan, et al.
Pubblicazione: (2026)
Language-Image Alignment with Fixed Text Encoders
di: Yang, Jingfeng, et al.
Pubblicazione: (2025)
di: Yang, Jingfeng, et al.
Pubblicazione: (2025)
Two-stage Rainfall-Forecasting Diffusion Model
di: Ling, XuDong, et al.
Pubblicazione: (2024)
di: Ling, XuDong, et al.
Pubblicazione: (2024)
DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
Human detectors are surprisingly powerful reward models
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Visual Lexicon: Rich Image Features in Language Space
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Representation Alignment Contrastive Regularization for Multi-Object Tracking
di: Liu, Zhonglin, et al.
Pubblicazione: (2024)
di: Liu, Zhonglin, et al.
Pubblicazione: (2024)
Fine-Grained DINO Tuning with Dual Supervision for Face Forgery Detection
di: Zhang, Tianxiang, et al.
Pubblicazione: (2025)
di: Zhang, Tianxiang, et al.
Pubblicazione: (2025)
Tri-path DINO: Feature Complementary Learning for Remote Sensing Multi-Class Change Detection
di: Zheng, Kai, et al.
Pubblicazione: (2026)
di: Zheng, Kai, et al.
Pubblicazione: (2026)
Empowering DINO Representations for Underwater Instance Segmentation via Aligner and Prompter
di: Chen, Zhiyang, et al.
Pubblicazione: (2025)
di: Chen, Zhiyang, et al.
Pubblicazione: (2025)
Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
DIVE: Taming DINO for Subject-Driven Video Editing
di: Huang, Yi, et al.
Pubblicazione: (2024)
di: Huang, Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
White-Box Transformers via Sparse Rate Reduction: Compression Is All There Is?
di: Yu, Yaodong, et al.
Pubblicazione: (2023) -
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024) -
DINO-AD: Unsupervised Anomaly Detection with Frozen DINO-V3 Features
di: Huo, Jiayu, et al.
Pubblicazione: (2026) -
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024) -
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
di: Liu, Shilong, et al.
Pubblicazione: (2023)