COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Chunhui, Liu, Li, Gao, Jialin, Sun, Xin, Wen, Hao, Zhou, Xi, Ge, Shiming, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
Awesome Multi-modal Object Tracking
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
by: Zhang, Chunhui, et al.
Published: (2023)
by: Zhang, Chunhui, et al.
Published: (2023)
MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
by: Zhang, Chunhui, et al.
Published: (2024)
by: Zhang, Chunhui, et al.
Published: (2024)
How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Distilling Channels for Efficient Deep Tracking
by: Ge, Shiming, et al.
Published: (2024)
by: Ge, Shiming, et al.
Published: (2024)
Fast-COS: A Fast One-Stage Object Detector Based on Reparameterized Attention Vision Transformer for Autonomous Driving
by: Setyawan, Novendra, et al.
Published: (2025)
by: Setyawan, Novendra, et al.
Published: (2025)
Contrastive Learning for Multi-Object Tracking with Transformers
by: De Plaen, Pierre-François, et al.
Published: (2023)
by: De Plaen, Pierre-François, et al.
Published: (2023)
FocusTrack: One-Stage Focus-and-Suppress Framework for 3D Point Cloud Object Tracking
by: Zhou, Sifan, et al.
Published: (2026)
by: Zhou, Sifan, et al.
Published: (2026)
Tracking and Understanding Object Transformations
by: Sun, Yihong, et al.
Published: (2025)
by: Sun, Yihong, et al.
Published: (2025)
Low-Resolution Object Recognition with Cross-Resolution Relational Contrastive Distillation
by: Zhang, Kangkai, et al.
Published: (2024)
by: Zhang, Kangkai, et al.
Published: (2024)
Representation Alignment Contrastive Regularization for Multi-Object Tracking
by: Liu, Zhonglin, et al.
Published: (2024)
by: Liu, Zhonglin, et al.
Published: (2024)
FreqTrack: Frequency Learning based Vision Transformer for RGB-Event Object Tracking
by: You, Jinlin, et al.
Published: (2026)
by: You, Jinlin, et al.
Published: (2026)
Unifying Visual and Vision-Language Tracking via Contrastive Learning
by: Ma, Yinchao, et al.
Published: (2024)
by: Ma, Yinchao, et al.
Published: (2024)
Look One and More: Distilling Hybrid Order Relational Knowledge for Cross-Resolution Image Recognition
by: Ge, Shiming, et al.
Published: (2024)
by: Ge, Shiming, et al.
Published: (2024)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
by: Ding, Xichen, et al.
Published: (2025)
by: Ding, Xichen, et al.
Published: (2025)
Exploring Dynamic Transformer for Efficient Object Tracking
by: Zhu, Jiawen, et al.
Published: (2024)
by: Zhu, Jiawen, et al.
Published: (2024)
General Compression Framework for Efficient Transformer Object Tracking
by: Hong, Lingyi, et al.
Published: (2024)
by: Hong, Lingyi, et al.
Published: (2024)
Target-aware Bidirectional Fusion Transformer for Aerial Object Tracking
by: Sun, Xinglong, et al.
Published: (2025)
by: Sun, Xinglong, et al.
Published: (2025)
A Simple yet Effective Network based on Vision Transformer for Camouflaged Object and Salient Object Detection
by: Hao, Chao, et al.
Published: (2024)
by: Hao, Chao, et al.
Published: (2024)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2025)
by: Ding, Kun, et al.
Published: (2025)
DA-Mamba: Domain Adaptive Hybrid Mamba-Transformer Based One-Stage Object Detection
by: Doruk, A. Enes, et al.
Published: (2025)
by: Doruk, A. Enes, et al.
Published: (2025)
The Progression of Transformers from Language to Vision to MOT: A Literature Review on Multi-Object Tracking with Transformers
by: Kamboj, Abhi
Published: (2024)
by: Kamboj, Abhi
Published: (2024)
Small Language Model Meets with Reinforced Vision Vocabulary
by: Wei, Haoran, et al.
Published: (2024)
by: Wei, Haoran, et al.
Published: (2024)
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
by: Bonat, Laurence, et al.
Published: (2026)
by: Bonat, Laurence, et al.
Published: (2026)
AP-Loss for Accurate One-Stage Object Detection
by: Chen, Kean, et al.
Published: (2020)
by: Chen, Kean, et al.
Published: (2020)
MeMOTR: Long-Term Memory-Augmented Transformer for Multi-Object Tracking
by: Gao, Ruopeng, et al.
Published: (2023)
by: Gao, Ruopeng, et al.
Published: (2023)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
by: Jiang, Yanfeng, et al.
Published: (2024)
by: Jiang, Yanfeng, et al.
Published: (2024)
DeTrack: In-model Latent Denoising Learning for Visual Object Tracking
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
History-Aware Transformation of ReID Features for Multiple Object Tracking
by: Gao, Ruopeng, et al.
Published: (2025)
by: Gao, Ruopeng, et al.
Published: (2025)
Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models
by: Schrodi, Simon, et al.
Published: (2024)
by: Schrodi, Simon, et al.
Published: (2024)
A Vision-Based Closed-Form Solution for Measuring the Rotation Rate of an Object by Tracking One Point
by: Raviv, Daniel, et al.
Published: (2025)
by: Raviv, Daniel, et al.
Published: (2025)
Tracking Transforming Objects: A Benchmark
by: Wu, You, et al.
Published: (2024)
by: Wu, You, et al.
Published: (2024)
One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models
by: Zhao, Jiale, et al.
Published: (2025)
by: Zhao, Jiale, et al.
Published: (2025)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
by: Zhang, Yiwei, et al.
Published: (2026)
by: Zhang, Yiwei, et al.
Published: (2026)
Towards Accurate One-Stage Object Detection with AP-Loss
by: Chen, Kean, et al.
Published: (2019)
by: Chen, Kean, et al.
Published: (2019)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
by: Li, Wanyun, et al.
Published: (2024)
by: Li, Wanyun, et al.
Published: (2024)
Cross-Image Contrastive Decoding: Precise, Lossless Suppression of Language Priors in Large Vision-Language Models
by: Zhao, Jianfei, et al.
Published: (2025)
by: Zhao, Jianfei, et al.
Published: (2025)
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again
by: Li, Weize, et al.
Published: (2025)
by: Li, Weize, et al.
Published: (2025)
Similar Items
-
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
by: Zhang, Chunhui, et al.
Published: (2024) -
Awesome Multi-modal Object Tracking
by: Zhang, Chunhui, et al.
Published: (2024) -
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
by: Zhang, Chunhui, et al.
Published: (2023) -
MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
by: Zhang, Chunhui, et al.
Published: (2024) -
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
by: Zhang, Chunhui, et al.
Published: (2024)