DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Jose, Cijo, Moutakanni, Théo, Kang, Dahyun, Baldassarre, Federico, Darcet, Timothée, Xu, Hu, Li, Daniel, Szafraniec, Marc, Ramamonjisoa, Michaël, Oquab, Maxime, Siméoni, Oriane, Vo, Huy V., Labatut, Patrick, Bojanowski, Piotr |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DINOv3
by: Siméoni, Oriane, et al.
Published: (2025)
by: Siméoni, Oriane, et al.
Published: (2025)
Cluster and Predict Latent Patches for Improved Masked Image Modeling
by: Darcet, Timothée, et al.
Published: (2025)
by: Darcet, Timothée, et al.
Published: (2025)
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
by: Moutakanni, Théo, et al.
Published: (2024)
by: Moutakanni, Théo, et al.
Published: (2024)
Vision Transformers Need Registers
by: Darcet, Timothée, et al.
Published: (2023)
by: Darcet, Timothée, et al.
Published: (2023)
Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach
by: Vo, Huy V., et al.
Published: (2024)
by: Vo, Huy V., et al.
Published: (2024)
DINOv2: Learning Robust Visual Features without Supervision
by: Oquab, Maxime, et al.
Published: (2023)
by: Oquab, Maxime, et al.
Published: (2023)
Revisiting [CLS] and Patch Token Interaction in Vision Transformers
by: Marouani, Alexis, et al.
Published: (2026)
by: Marouani, Alexis, et al.
Published: (2026)
Efficient Universal Perception Encoder
by: Zhu, Chenchen, et al.
Published: (2026)
by: Zhu, Chenchen, et al.
Published: (2026)
CHMv2: Improvements in Global Canopy Height Mapping using DINOv3
by: Brandt, John, et al.
Published: (2026)
by: Brandt, John, et al.
Published: (2026)
Back to the Features: DINO as a Foundation for Video World Models
by: Baldassarre, Federico, et al.
Published: (2025)
by: Baldassarre, Federico, et al.
Published: (2025)
Disentangling the Factors of Convergence between Brains and Computer Vision Models
by: Raugel, Joséphine, et al.
Published: (2025)
by: Raugel, Joséphine, et al.
Published: (2025)
Advancing human-centric AI for robust X-ray analysis through holistic self-supervised learning
by: Moutakanni, Théo, et al.
Published: (2024)
by: Moutakanni, Théo, et al.
Published: (2024)
Misalignment Between Backpropagation and the Hierarchy of Brain Responses to Images
by: Raugel, Joséphine, et al.
Published: (2026)
by: Raugel, Joséphine, et al.
Published: (2026)
CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation
by: Wysoczańska, Monika, et al.
Published: (2023)
by: Wysoczańska, Monika, et al.
Published: (2023)
MILAN: Milli-Annotations for Lidar Semantic Segmentation
by: Samet, Nermin, et al.
Published: (2024)
by: Samet, Nermin, et al.
Published: (2024)
AdaVFM: Adaptive Vision Foundation Models for Edge Intelligence via LLM-Guided Execution
by: Zhao, Yiwei, et al.
Published: (2026)
by: Zhao, Yiwei, et al.
Published: (2026)
LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension
by: Cardiel, Amaia, et al.
Published: (2024)
by: Cardiel, Amaia, et al.
Published: (2024)
Unsupervised Object Localization in the Era of Self-Supervised ViTs: A Survey
by: Siméoni, Oriane, et al.
Published: (2023)
by: Siméoni, Oriane, et al.
Published: (2023)
Decentralising LLM Alignment: A Case for Context, Pluralism, and Participation
by: Peter, Oriane, et al.
Published: (2025)
by: Peter, Oriane, et al.
Published: (2025)
Real-Time Object Detection Meets DINOv3
by: Huang, Shihua, et al.
Published: (2025)
by: Huang, Shihua, et al.
Published: (2025)
Numerical analysis of a non-clamped dynamic thermoviscoelastic contact problem
by: Bartman, Piotr, et al.
Published: (2019)
by: Bartman, Piotr, et al.
Published: (2019)
DINOv3 Meets YOLO26 for Weed Detection in Vegetable Crops
by: Deng, Boyang, et al.
Published: (2026)
by: Deng, Boyang, et al.
Published: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
by: Liu, Ye, et al.
Published: (2025)
by: Liu, Ye, et al.
Published: (2025)
Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-modal Distillation
by: Vobecky, Antonin, et al.
Published: (2022)
by: Vobecky, Antonin, et al.
Published: (2022)
Test-time Contrastive Concepts for Open-world Semantic Segmentation with Vision-Language Models
by: Wysoczańska, Monika, et al.
Published: (2024)
by: Wysoczańska, Monika, et al.
Published: (2024)
MOCA: Self-supervised Representation Learning by Predicting Masked Online Codebook Assignments
by: Gidaris, Spyros, et al.
Published: (2023)
by: Gidaris, Spyros, et al.
Published: (2023)
POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images
by: Vobecky, Antonin, et al.
Published: (2024)
by: Vobecky, Antonin, et al.
Published: (2024)
VGGT-$Ω$
by: Wang, Jianyuan, et al.
Published: (2026)
by: Wang, Jianyuan, et al.
Published: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
by: Peng, Dezhi, et al.
Published: (2023)
by: Peng, Dezhi, et al.
Published: (2023)
Stationary measures for the Porous Medium Model
by: Blondel, Oriane
Published: (2024)
by: Blondel, Oriane
Published: (2024)
Convergence of a double step scheme for a class of second order Clarke subdifferential inclusions
by: Bartosz, Krzysztof, et al.
Published: (2023)
by: Bartosz, Krzysztof, et al.
Published: (2023)
NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization
by: Cheng, Yik San, et al.
Published: (2026)
by: Cheng, Yik San, et al.
Published: (2026)
Inter-flake transport and humidity response of Ti3C2Tx MXene at the nanoscale
by: de Leuze, Oriane, et al.
Published: (2025)
by: de Leuze, Oriane, et al.
Published: (2025)
From Pixels to Prompts: Vision-Language Models
by: Vo, Khang Hoang Nhat
Published: (2026)
by: Vo, Khang Hoang Nhat
Published: (2026)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
by: Yang, Cheng, et al.
Published: (2026)
by: Yang, Cheng, et al.
Published: (2026)
Three Pillars improving Vision Foundation Model Distillation for Lidar
by: Puy, Gilles, et al.
Published: (2023)
by: Puy, Gilles, et al.
Published: (2023)
Closures of moment expansion of anisotropic active Brownian particles
by: Gautry, Timothée, et al.
Published: (2025)
by: Gautry, Timothée, et al.
Published: (2025)
Waterbird responses to experimental drawdown : implications for the multispecies management of wetland mosaics. / Oriane W. Taft
by: Taft, Oriane W
Published: (1994)
by: Taft, Oriane W
Published: (1994)
Planning with Reasoning using Vision Language World Model
by: Chen, Delong, et al.
Published: (2025)
by: Chen, Delong, et al.
Published: (2025)
Why Interest Groups With Divergent Goals Collaborate: Evidence From Climate Regulation
by: Dahyun Choi
Published: (2025)
by: Dahyun Choi
Published: (2025)
Similar Items
-
DINOv3
by: Siméoni, Oriane, et al.
Published: (2025) -
Cluster and Predict Latent Patches for Improved Masked Image Modeling
by: Darcet, Timothée, et al.
Published: (2025) -
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
by: Moutakanni, Théo, et al.
Published: (2024) -
Vision Transformers Need Registers
by: Darcet, Timothée, et al.
Published: (2023) -
Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach
by: Vo, Huy V., et al.
Published: (2024)