Can Visual Foundation Models Achieve Long-term Point Tracking?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aydemir, Görkay, Xie, Weidi, Güney, Fatma |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Track-On2: Enhancing Online Point Tracking with Memory
par: Aydemir, Görkay, et autres
Publié: (2025)
par: Aydemir, Görkay, et autres
Publié: (2025)
Real-World Point Tracking with Verifier-Guided Pseudo-Labeling
par: Aydemir, Görkay, et autres
Publié: (2026)
par: Aydemir, Görkay, et autres
Publié: (2026)
Track-On: Transformer-based Online Point Tracking with Memory
par: Aydemir, Görkay, et autres
Publié: (2025)
par: Aydemir, Görkay, et autres
Publié: (2025)
Online Long-term Point Tracking in the Foundation Model Era
par: Aydemir, Görkay
Publié: (2025)
par: Aydemir, Görkay
Publié: (2025)
Robust Bird's Eye View Segmentation by Adapting DINOv2
par: Barın, Merve Rabia, et autres
Publié: (2024)
par: Barın, Merve Rabia, et autres
Publié: (2024)
Segment-Level Road Obstacle Detection Using Visual Foundation Model Priors and Likelihood Ratios
par: Shoeb, Youssef, et autres
Publié: (2024)
par: Shoeb, Youssef, et autres
Publié: (2024)
O1O: Grouping of Known Classes to Identify Unknown Objects as Odd-One-Out
par: Yavuz, Mısra, et autres
Publié: (2024)
par: Yavuz, Mısra, et autres
Publié: (2024)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
par: Yan, Yibin, et autres
Publié: (2024)
par: Yan, Yibin, et autres
Publié: (2024)
LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry
par: Chen, Weirong, et autres
Publié: (2024)
par: Chen, Weirong, et autres
Publié: (2024)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Multi-Sentence Grounding for Long-term Instructional Video
par: Li, Zeqian, et autres
Publié: (2023)
par: Li, Zeqian, et autres
Publié: (2023)
A Likelihood Ratio-Based Approach to Segmenting Unknown Objects
par: Nayal, Nazir, et autres
Publié: (2024)
par: Nayal, Nazir, et autres
Publié: (2024)
Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning
par: Rahimi, Nasrin, et autres
Publié: (2026)
par: Rahimi, Nasrin, et autres
Publié: (2026)
CarFormer: Self-Driving with Learned Object-Centric Representations
par: Hamdan, Shadi, et autres
Publié: (2024)
par: Hamdan, Shadi, et autres
Publié: (2024)
Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction
par: Emirdagi, Ahmet Rasim, et autres
Publié: (2026)
par: Emirdagi, Ahmet Rasim, et autres
Publié: (2026)
Revisiting Multi-Task Visual Representation Learning
par: Di, Shangzhe, et autres
Publié: (2026)
par: Di, Shangzhe, et autres
Publié: (2026)
Mapping like a Skeptic: Probabilistic BEV Projection for Online HD Mapping
par: Erdoğan, Fatih, et autres
Publié: (2025)
par: Erdoğan, Fatih, et autres
Publié: (2025)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024)
par: Chen, Qirui, et autres
Publié: (2024)
Self-Evolving Depth-Supervised 3D Gaussian Splatting from Rendered Stereo Pairs
par: Safadoust, Sadra, et autres
Publié: (2024)
par: Safadoust, Sadra, et autres
Publié: (2024)
FlowIt: Global Matching via Hierarchical Transformers and Optimal Transport for Optical Flow
par: Safadoust, Sadra, et autres
Publié: (2026)
par: Safadoust, Sadra, et autres
Publié: (2026)
WarpRF: Multi-View Consistency for Training-Free Uncertainty Quantification and Applications in Radiance Fields
par: Safadoust, Sadra, et autres
Publié: (2025)
par: Safadoust, Sadra, et autres
Publié: (2025)
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
par: Wu, Qiangqiang, et autres
Publié: (2026)
par: Wu, Qiangqiang, et autres
Publié: (2026)
SoccerMaster: A Vision Foundation Model for Soccer Understanding
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
Inferring Dynamic Physical Properties from Video Foundation Models
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Test-time Correction: An Online 3D Detection System via Visual Prompting
par: Zhang, Hanxue, et autres
Publié: (2024)
par: Zhang, Hanxue, et autres
Publié: (2024)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
par: Liu, Chang, et autres
Publié: (2023)
par: Liu, Chang, et autres
Publié: (2023)
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023)
par: Xie, Junyu, et autres
Publié: (2023)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
par: Li, Haolin, et autres
Publié: (2024)
par: Li, Haolin, et autres
Publié: (2024)
ETA: Efficiency through Thinking Ahead, A Dual Approach to Self-Driving with Large Models
par: Hamdan, Shadi, et autres
Publié: (2025)
par: Hamdan, Shadi, et autres
Publié: (2025)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
Knowledge-enhanced Visual-Language Pretraining for Computational Pathology
par: Zhou, Xiao, et autres
Publié: (2024)
par: Zhou, Xiao, et autres
Publié: (2024)
OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning
par: Hong, Lingyi, et autres
Publié: (2024)
par: Hong, Lingyi, et autres
Publié: (2024)
MambaLCT: Boosting Tracking via Long-term Context State Space Model
par: Li, Xiaohai, et autres
Publié: (2024)
par: Li, Xiaohai, et autres
Publié: (2024)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
Count Anything at Any Granularity
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?
par: Zheng, Qiaoyu, et autres
Publié: (2024)
par: Zheng, Qiaoyu, et autres
Publié: (2024)
Moving Object Segmentation: All You Need Is SAM (and Flow)
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
Documents similaires
-
Track-On2: Enhancing Online Point Tracking with Memory
par: Aydemir, Görkay, et autres
Publié: (2025) -
Real-World Point Tracking with Verifier-Guided Pseudo-Labeling
par: Aydemir, Görkay, et autres
Publié: (2026) -
Track-On: Transformer-based Online Point Tracking with Memory
par: Aydemir, Görkay, et autres
Publié: (2025) -
Online Long-term Point Tracking in the Foundation Model Era
par: Aydemir, Görkay
Publié: (2025) -
Robust Bird's Eye View Segmentation by Adapting DINOv2
par: Barın, Merve Rabia, et autres
Publié: (2024)