DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Chenbin, He, Wenbin, Tu, Zhengzhong, Ren, Liu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
por: Pan, Jiazhen, et al.
Publicado: (2025)
por: Pan, Jiazhen, et al.
Publicado: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
por: Huang, Wenxuan, et al.
Publicado: (2025)
por: Huang, Wenxuan, et al.
Publicado: (2025)
Surgical-DINO: Adapter Learning of Foundation Models for Depth Estimation in Endoscopic Surgery
por: Cui, Beilei, et al.
Publicado: (2024)
por: Cui, Beilei, et al.
Publicado: (2024)
Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking
por: Hu, Chan-Wei, et al.
Publicado: (2026)
por: Hu, Chan-Wei, et al.
Publicado: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)
por: Tian, Kexin, et al.
Publicado: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
por: Huang, Wenxuan, et al.
Publicado: (2026)
por: Huang, Wenxuan, et al.
Publicado: (2026)
DRAMA-X: A Fine-grained Intent Prediction and Risk Reasoning Benchmark For Driving
por: Godbole, Mihir, et al.
Publicado: (2025)
por: Godbole, Mihir, et al.
Publicado: (2025)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
por: Shen, Chuming, et al.
Publicado: (2025)
por: Shen, Chuming, et al.
Publicado: (2025)
A Mixed Diet Makes DINO An Omnivorous Vision Encoder
por: Kabra, Rishabh, et al.
Publicado: (2026)
por: Kabra, Rishabh, et al.
Publicado: (2026)
DIVE: Taming DINO for Subject-Driven Video Editing
por: Huang, Yi, et al.
Publicado: (2024)
por: Huang, Yi, et al.
Publicado: (2024)
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
por: Zeng, Haoxi, et al.
Publicado: (2026)
por: Zeng, Haoxi, et al.
Publicado: (2026)
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
por: Xia, Shao-Jun, et al.
Publicado: (2025)
por: Xia, Shao-Jun, et al.
Publicado: (2025)
AdaRing: Towards Ultra-Light Vision-Language Adaptation via Cross-Layer Tensor Ring Decomposition
por: Huang, Ying, et al.
Publicado: (2025)
por: Huang, Ying, et al.
Publicado: (2025)
DINO-VO: A Feature-based Visual Odometry Leveraging a Visual Foundation Model
por: Azhari, Maulana Bisyir, et al.
Publicado: (2025)
por: Azhari, Maulana Bisyir, et al.
Publicado: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
por: Shangguan, Ziyao, et al.
Publicado: (2024)
por: Shangguan, Ziyao, et al.
Publicado: (2024)
DinoTwins: Combining DINO and Barlow Twins for Robust, Label-Efficient Vision Transformers
por: Podsiadly, Michael, et al.
Publicado: (2025)
por: Podsiadly, Michael, et al.
Publicado: (2025)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
por: Tian, Xinyu, et al.
Publicado: (2025)
por: Tian, Xinyu, et al.
Publicado: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling
por: Li, Wenjie, et al.
Publicado: (2026)
por: Li, Wenjie, et al.
Publicado: (2026)
CAST: Contrastive Adaptation and Distillation for Semi-Supervised Instance Segmentation
por: Taghavi, Pardis, et al.
Publicado: (2025)
por: Taghavi, Pardis, et al.
Publicado: (2025)
DINO-CVA: A Multimodal Goal-Conditioned Vision-to-Action Model for Autonomous Catheter Navigation
por: Fekri, Pedram, et al.
Publicado: (2025)
por: Fekri, Pedram, et al.
Publicado: (2025)
BrainDINO: A Brain MRI Foundation Model for Generalizable Clinical Representation Learning
por: Wu, Yizhou, et al.
Publicado: (2026)
por: Wu, Yizhou, et al.
Publicado: (2026)
Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1
por: Munagala, Abhinav
Publicado: (2026)
por: Munagala, Abhinav
Publicado: (2026)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
por: Rasaee, Hamza, et al.
Publicado: (2025)
por: Rasaee, Hamza, et al.
Publicado: (2025)
Swiss DINO: Efficient and Versatile Vision Framework for On-device Personal Object Search
por: Paramonov, Kirill, et al.
Publicado: (2024)
por: Paramonov, Kirill, et al.
Publicado: (2024)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
por: Feng, Ruimin, et al.
Publicado: (2025)
por: Feng, Ruimin, et al.
Publicado: (2025)
Simplifying DINO via Coding Rate Regularization
por: Wu, Ziyang, et al.
Publicado: (2025)
por: Wu, Ziyang, et al.
Publicado: (2025)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
por: Wang, Daming, et al.
Publicado: (2025)
por: Wang, Daming, et al.
Publicado: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
por: He, Yuting, et al.
Publicado: (2026)
por: He, Yuting, et al.
Publicado: (2026)
InterVLS: Interactive Model Understanding and Improvement with Vision-Language Surrogates
por: Huang, Jinbin, et al.
Publicado: (2023)
por: Huang, Jinbin, et al.
Publicado: (2023)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
por: He, Xingxin, et al.
Publicado: (2025)
por: He, Xingxin, et al.
Publicado: (2025)
Reprogramming Vision Foundation Models for Spatio-Temporal Forecasting
por: Chen, Changlu, et al.
Publicado: (2025)
por: Chen, Changlu, et al.
Publicado: (2025)
STAMP: Scalable Task And Model-agnostic Collaborative Perception
por: Gao, Xiangbo, et al.
Publicado: (2025)
por: Gao, Xiangbo, et al.
Publicado: (2025)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
por: Xiao, Tong, et al.
Publicado: (2025)
por: Xiao, Tong, et al.
Publicado: (2025)
MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models
por: Wang, Kangkang, et al.
Publicado: (2026)
por: Wang, Kangkang, et al.
Publicado: (2026)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
por: Shiri, Fatemeh, et al.
Publicado: (2024)
por: Shiri, Fatemeh, et al.
Publicado: (2024)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
por: Zhao, Baining, et al.
Publicado: (2025)
por: Zhao, Baining, et al.
Publicado: (2025)
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
por: Fan, Jiawei, et al.
Publicado: (2026)
por: Fan, Jiawei, et al.
Publicado: (2026)
Ejemplares similares
-
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
por: Pan, Jiazhen, et al.
Publicado: (2025) -
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
por: Huang, Wenxuan, et al.
Publicado: (2025) -
Surgical-DINO: Adapter Learning of Foundation Models for Depth Estimation in Endoscopic Surgery
por: Cui, Beilei, et al.
Publicado: (2024) -
Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking
por: Hu, Chan-Wei, et al.
Publicado: (2026) -
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)