DINO-CoDT: Multi-class Collaborative Detection and Tracking with Vision Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Xunjie, Lee, Christina Dao Wen, Wang, Meiling, Yuan, Chengran, Huang, Zefan, Yue, Yufeng, Ang Jr, Marcelo H. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PIE: Perception and Interaction Enhanced End-to-End Motion Planning for Autonomous Driving
di: Yuan, Chengran, et al.
Pubblicazione: (2025)
di: Yuan, Chengran, et al.
Pubblicazione: (2025)
DRAMA: An Efficient End-to-end Motion Planner for Autonomous Driving with Mamba
di: Yuan, Chengran, et al.
Pubblicazione: (2024)
di: Yuan, Chengran, et al.
Pubblicazione: (2024)
AGI-Elo: How Far Are We From Mastering A Task?
di: Sun, Shuo, et al.
Pubblicazione: (2025)
di: Sun, Shuo, et al.
Pubblicazione: (2025)
RMP-YOLO: A Robust Motion Predictor for Partially Observable Scenarios even if You Only Look Once
di: Sun, Jiawei, et al.
Pubblicazione: (2024)
di: Sun, Jiawei, et al.
Pubblicazione: (2024)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments
di: Yu, Meng, et al.
Pubblicazione: (2024)
di: Yu, Meng, et al.
Pubblicazione: (2024)
ControlMTR: Control-Guided Motion Transformer with Scene-Compliant Intention Points for Feasible Motion Prediction
di: Sun, Jiawei, et al.
Pubblicazione: (2024)
di: Sun, Jiawei, et al.
Pubblicazione: (2024)
GL-DT: Multi-UAV Detection and Tracking with Global-Local Integration
di: Liu, Juanqin, et al.
Pubblicazione: (2025)
di: Liu, Juanqin, et al.
Pubblicazione: (2025)
Rewarding DINO: Predicting Dense Rewards with Vision Foundation Models
di: Krack, Pierre, et al.
Pubblicazione: (2026)
di: Krack, Pierre, et al.
Pubblicazione: (2026)
3D Affordance Keypoint Detection for Robotic Manipulation
di: Liu, Zhiyang, et al.
Pubblicazione: (2025)
di: Liu, Zhiyang, et al.
Pubblicazione: (2025)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
di: Liang, Zhuonan, et al.
Pubblicazione: (2026)
di: Liang, Zhuonan, et al.
Pubblicazione: (2026)
CARLA-Loc: Synthetic SLAM Dataset with Full-stack Sensor Setup in Challenging Weather and Dynamic Environments
di: Han, Yuhang, et al.
Pubblicazione: (2023)
di: Han, Yuhang, et al.
Pubblicazione: (2023)
RMGS-SLAM: Real-time Multi-sensor Gaussian Splatting SLAM
di: Li, Dongen, et al.
Pubblicazione: (2026)
di: Li, Dongen, et al.
Pubblicazione: (2026)
DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
IMPACT: Behavioral Intention-aware Multimodal Trajectory Prediction with Adaptive Context Trimming
di: Sun, Jiawei, et al.
Pubblicazione: (2025)
di: Sun, Jiawei, et al.
Pubblicazione: (2025)
Evaluating Stenosis Detection with Grounding DINO, YOLO, and DINO-DETR
di: Ansari, Muhammad Musab
Pubblicazione: (2025)
di: Ansari, Muhammad Musab
Pubblicazione: (2025)
SpectraDINO: Bridging the Spectral Gap in Vision Foundation Models via Lightweight Adapters
di: Nalcakan, Yagiz, et al.
Pubblicazione: (2026)
di: Nalcakan, Yagiz, et al.
Pubblicazione: (2026)
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model
di: Kim, Jihyeok, et al.
Pubblicazione: (2025)
di: Kim, Jihyeok, et al.
Pubblicazione: (2025)
ADM: Accelerated Diffusion Model via Estimated Priors for Robust Motion Prediction under Uncertainties
di: Li, Jiahui, et al.
Pubblicazione: (2024)
di: Li, Jiahui, et al.
Pubblicazione: (2024)
DriveSceneGen: Generating Diverse and Realistic Driving Scenarios from Scratch
di: Sun, Shuo, et al.
Pubblicazione: (2023)
di: Sun, Shuo, et al.
Pubblicazione: (2023)
Point Tree Transformer for Point Cloud Registration
di: Wang, Meiling, et al.
Pubblicazione: (2024)
di: Wang, Meiling, et al.
Pubblicazione: (2024)
CR3DT: Camera-RADAR Fusion for 3D Detection and Tracking
di: Baumann, Nicolas, et al.
Pubblicazione: (2024)
di: Baumann, Nicolas, et al.
Pubblicazione: (2024)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
DINO-AD: Unsupervised Anomaly Detection with Frozen DINO-V3 Features
di: Huo, Jiayu, et al.
Pubblicazione: (2026)
di: Huo, Jiayu, et al.
Pubblicazione: (2026)
EndoDINO: A Foundation Model for GI Endoscopy
di: Dermyer, Patrick, et al.
Pubblicazione: (2025)
di: Dermyer, Patrick, et al.
Pubblicazione: (2025)
When Language Model Guides Vision: Grounding DINO for Cattle Muzzle Detection
di: Dulal, Rabin, et al.
Pubblicazione: (2025)
di: Dulal, Rabin, et al.
Pubblicazione: (2025)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
di: Liu, Shilong, et al.
Pubblicazione: (2023)
di: Liu, Shilong, et al.
Pubblicazione: (2023)
DINO-Foresight: Looking into the Future with DINO
di: Karypidis, Efstathios, et al.
Pubblicazione: (2024)
di: Karypidis, Efstathios, et al.
Pubblicazione: (2024)
DINO-LG: Enhancing Vision Transformers with Label Guidance for Coronary Artery Calcium Detection
di: Gokmen, Mahmut S., et al.
Pubblicazione: (2024)
di: Gokmen, Mahmut S., et al.
Pubblicazione: (2024)
Back to the Features: DINO as a Foundation for Video World Models
di: Baldassarre, Federico, et al.
Pubblicazione: (2025)
di: Baldassarre, Federico, et al.
Pubblicazione: (2025)
DINO-Tok: Adapting DINO for Visual Tokenizers
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
DexGrasp-Diffusion: Diffusion-based Unified Functional Grasp Synthesis Method for Multi-Dexterous Robotic Hands
di: Zhang, Zhengshen, et al.
Pubblicazione: (2024)
di: Zhang, Zhengshen, et al.
Pubblicazione: (2024)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
A Mixed Diet Makes DINO An Omnivorous Vision Encoder
di: Kabra, Rishabh, et al.
Pubblicazione: (2026)
di: Kabra, Rishabh, et al.
Pubblicazione: (2026)
DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation
di: Knaebel, Karim, et al.
Pubblicazione: (2025)
di: Knaebel, Karim, et al.
Pubblicazione: (2025)
DBT-DINO: Towards Foundation model based analysis of Digital Breast Tomosynthesis
di: Dorfner, Felix J., et al.
Pubblicazione: (2025)
di: Dorfner, Felix J., et al.
Pubblicazione: (2025)
DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification
di: Zimmermann, Robert, et al.
Pubblicazione: (2026)
di: Zimmermann, Robert, et al.
Pubblicazione: (2026)
Surgical-DINO: Adapter Learning of Foundation Models for Depth Estimation in Endoscopic Surgery
di: Cui, Beilei, et al.
Pubblicazione: (2024)
di: Cui, Beilei, et al.
Pubblicazione: (2024)
TASeg: Text-aware RGB-T Semantic Segmentation based on Fine-tuning Vision Foundation Models
di: Yu, Meng, et al.
Pubblicazione: (2025)
di: Yu, Meng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PIE: Perception and Interaction Enhanced End-to-End Motion Planning for Autonomous Driving
di: Yuan, Chengran, et al.
Pubblicazione: (2025) -
DRAMA: An Efficient End-to-end Motion Planner for Autonomous Driving with Mamba
di: Yuan, Chengran, et al.
Pubblicazione: (2024) -
AGI-Elo: How Far Are We From Mastering A Task?
di: Sun, Shuo, et al.
Pubblicazione: (2025) -
RMP-YOLO: A Robust Motion Predictor for Partially Observable Scenarios even if You Only Look Once
di: Sun, Jiawei, et al.
Pubblicazione: (2024) -
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
di: Pan, Chenbin, et al.
Pubblicazione: (2025)