CLDTracker: A Comprehensive Language Description for Visual Tracking
Fuente:
arXiv
Saved in:
| Main Authors: | Alansari, Mohamad, Javed, Sajid, Ganapathi, Iyyakutti Iyappan, Alansari, Sara, Naseer, Muzammal |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
by: Alansari, Mohamad, et al.
Published: (2026)
by: Alansari, Mohamad, et al.
Published: (2026)
Rethinking Memory Design in SAM-Based Visual Object Tracking
by: Alansari, Mohamad, et al.
Published: (2025)
by: Alansari, Mohamad, et al.
Published: (2025)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
by: Alawode, Basit, et al.
Published: (2025)
by: Alawode, Basit, et al.
Published: (2025)
MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method
by: Bakht, Ahsan Baidar, et al.
Published: (2026)
by: Bakht, Ahsan Baidar, et al.
Published: (2026)
DyCON: Dynamic Uncertainty-aware Consistency and Contrastive Learning for Semi-supervised Medical Image Segmentation
by: Assefa, Maregu, et al.
Published: (2025)
by: Assefa, Maregu, et al.
Published: (2025)
CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language Alignment
by: Javed, Sajid, et al.
Published: (2024)
by: Javed, Sajid, et al.
Published: (2024)
Multi-Resolution Pathology-Language Pre-training Model with Text-Guided Visual Representation
by: Albastaki, Shahad, et al.
Published: (2025)
by: Albastaki, Shahad, et al.
Published: (2025)
Cytoplasmic Strings Analysis in Human Embryo Time-Lapse Videos using Deep Learning Framework
by: Sohail, Anabia, et al.
Published: (2025)
by: Sohail, Anabia, et al.
Published: (2025)
AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
Probing the Efficacy of Federated Parameter-Efficient Fine-Tuning of Vision Transformers for Medical Image Classification
by: Alkhunaizi, Naif, et al.
Published: (2024)
by: Alkhunaizi, Naif, et al.
Published: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
by: Malik, Hashmat Shadab, et al.
Published: (2024)
by: Malik, Hashmat Shadab, et al.
Published: (2024)
Enhancing Novel Object Detection via Cooperative Foundational Models
by: Bharadwaj, Rohit, et al.
Published: (2023)
by: Bharadwaj, Rohit, et al.
Published: (2023)
Predicting the Best of N Visual Trackers
by: Alawode, Basit, et al.
Published: (2024)
by: Alawode, Basit, et al.
Published: (2024)
STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection
by: Velayudhan, Divya, et al.
Published: (2025)
by: Velayudhan, Divya, et al.
Published: (2025)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
by: Chae, Hyunsik, et al.
Published: (2025)
by: Chae, Hyunsik, et al.
Published: (2025)
XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography
by: Luo, Haozhe, et al.
Published: (2025)
by: Luo, Haozhe, et al.
Published: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
by: Jin, Yizhang, et al.
Published: (2024)
by: Jin, Yizhang, et al.
Published: (2024)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
by: Zhen, Yihao, et al.
Published: (2025)
by: Zhen, Yihao, et al.
Published: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
by: Wang, Zhenhailong, et al.
Published: (2024)
by: Wang, Zhenhailong, et al.
Published: (2024)
Semantically-Prompted Language Models Improve Visual Descriptions
by: Ogezi, Michael, et al.
Published: (2023)
by: Ogezi, Michael, et al.
Published: (2023)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
by: Yuan, Liping, et al.
Published: (2025)
by: Yuan, Liping, et al.
Published: (2025)
MVTD: A Benchmark Dataset for Maritime Visual Object Tracking
by: Bakht, Ahsan Baidar, et al.
Published: (2025)
by: Bakht, Ahsan Baidar, et al.
Published: (2025)
Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models
by: Ghatkesar, Aarti, et al.
Published: (2025)
by: Ghatkesar, Aarti, et al.
Published: (2025)
Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
by: Lu, Kaixuan, et al.
Published: (2024)
by: Lu, Kaixuan, et al.
Published: (2024)
EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively
by: Wang, Bingyang, et al.
Published: (2025)
by: Wang, Bingyang, et al.
Published: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
by: Zhong, Chen, et al.
Published: (2026)
by: Zhong, Chen, et al.
Published: (2026)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
by: Li, Yuhao, et al.
Published: (2024)
by: Li, Yuhao, et al.
Published: (2024)
The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
by: Peng, Jinghan, et al.
Published: (2025)
by: Peng, Jinghan, et al.
Published: (2025)
DIVE: Towards Descriptive and Diverse Visual Commonsense Generation
by: Park, Jun-Hyung, et al.
Published: (2024)
by: Park, Jun-Hyung, et al.
Published: (2024)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
by: Xu, Haoran, et al.
Published: (2026)
by: Xu, Haoran, et al.
Published: (2026)
Language Guided Domain Generalized Medical Image Segmentation
by: Kunhimon, Shahina, et al.
Published: (2024)
by: Kunhimon, Shahina, et al.
Published: (2024)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
by: Ma, Guozheng, et al.
Published: (2022)
by: Ma, Guozheng, et al.
Published: (2022)
Visual Object Tracking across Diverse Data Modalities: A Review
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
MITracker: Multi-View Integration for Visual Object Tracking
by: Xu, Mengjie, et al.
Published: (2025)
by: Xu, Mengjie, et al.
Published: (2025)
RELO: Reinforcement Learning to Localize for Visual Object Tracking
by: Chen, Xin, et al.
Published: (2026)
by: Chen, Xin, et al.
Published: (2026)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
by: Wu, Kui, et al.
Published: (2025)
by: Wu, Kui, et al.
Published: (2025)
Accurate and Efficient Urban Street Tree Inventory with Deep Learning on Mobile Phone Imagery
by: Khan, Asim, et al.
Published: (2024)
by: Khan, Asim, et al.
Published: (2024)
All in One: Visual-Description-Guided Unified Point Cloud Segmentation
by: Han, Zongyan, et al.
Published: (2025)
by: Han, Zongyan, et al.
Published: (2025)
Adversarial Attack for RGB-Event based Visual Object Tracking
by: Chen, Qiang, et al.
Published: (2025)
by: Chen, Qiang, et al.
Published: (2025)
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
by: Ballout, Mohamad, et al.
Published: (2025)
by: Ballout, Mohamad, et al.
Published: (2025)
Similar Items
-
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
by: Alansari, Mohamad, et al.
Published: (2026) -
Rethinking Memory Design in SAM-Based Visual Object Tracking
by: Alansari, Mohamad, et al.
Published: (2025) -
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
by: Alawode, Basit, et al.
Published: (2025) -
MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method
by: Bakht, Ahsan Baidar, et al.
Published: (2026) -
DyCON: Dynamic Uncertainty-aware Consistency and Contrastive Learning for Semi-supervised Medical Image Segmentation
by: Assefa, Maregu, et al.
Published: (2025)