Explicit Context Reasoning with Supervision for Visual Tracking
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Fansheng, Zhong, Bineng, Xia, Haiying, Tan, Yufei, Hu, Xiantao, Shi, Liangtao, Song, Shuxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Explicit Visual Prompts for Visual Object Tracking
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
Adaptive Perception for Unified Visual Multi-modal Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
Learning to Track Instance from Single Nature Language Description
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
An Efficient Token Compression Framework for Visual Object Tracking
di: Wu, Weijing, et al.
Pubblicazione: (2026)
di: Wu, Weijing, et al.
Pubblicazione: (2026)
Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers
di: Xie, Jinxia, et al.
Pubblicazione: (2024)
di: Xie, Jinxia, et al.
Pubblicazione: (2024)
Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking
di: Yang, Hongtao, et al.
Pubblicazione: (2026)
di: Yang, Hongtao, et al.
Pubblicazione: (2026)
Decoupled Spatio-Temporal Consistency Learning for Self-Supervised Tracking
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
Less is More: Token Context-aware Learning for Object Tracking
di: Xu, Chenlong, et al.
Pubblicazione: (2025)
di: Xu, Chenlong, et al.
Pubblicazione: (2025)
Dynamic Updates for Language Adaptation in Visual-Language Tracking
di: Li, Xiaohai, et al.
Pubblicazione: (2025)
di: Li, Xiaohai, et al.
Pubblicazione: (2025)
Robust Tracking via Mamba-based Context-aware Token Learning
di: Xie, Jinxia, et al.
Pubblicazione: (2024)
di: Xie, Jinxia, et al.
Pubblicazione: (2024)
MambaLCT: Boosting Tracking via Long-term Context State Space Model
di: Li, Xiaohai, et al.
Pubblicazione: (2024)
di: Li, Xiaohai, et al.
Pubblicazione: (2024)
Similarity-Guided Layer-Adaptive Vision Transformer for UAV Tracking
di: Xue, Chaocan, et al.
Pubblicazione: (2025)
di: Xue, Chaocan, et al.
Pubblicazione: (2025)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2024)
di: Hu, Xiantao, et al.
Pubblicazione: (2024)
ODTrack: Online Dense Temporal Token Learning for Visual Tracking
di: Zheng, Yaozong, et al.
Pubblicazione: (2024)
di: Zheng, Yaozong, et al.
Pubblicazione: (2024)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Robust RGB-T Tracking via Learnable Visual Fourier Prompt Fine-tuning and Modality Fusion Prompt Generation
di: Yang, Hongtao, et al.
Pubblicazione: (2025)
di: Yang, Hongtao, et al.
Pubblicazione: (2025)
UBATrack: Spatio-Temporal State Space Model for General Multi-Modal Tracking
di: Liang, Qihua, et al.
Pubblicazione: (2026)
di: Liang, Qihua, et al.
Pubblicazione: (2026)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision
di: Wang, Pengcheng, et al.
Pubblicazione: (2026)
di: Wang, Pengcheng, et al.
Pubblicazione: (2026)
Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock
di: Sha, Haiying
Pubblicazione: (2026)
di: Sha, Haiying
Pubblicazione: (2026)
LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning
di: Xu, Haiying, et al.
Pubblicazione: (2026)
di: Xu, Haiying, et al.
Pubblicazione: (2026)
SkeleGuide: Explicit Skeleton Reasoning for Context-Aware Human-in-Place Image Synthesis
di: Wu, Chuqiao, et al.
Pubblicazione: (2026)
di: Wu, Chuqiao, et al.
Pubblicazione: (2026)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
di: Li, Yiwei, et al.
Pubblicazione: (2026)
di: Li, Yiwei, et al.
Pubblicazione: (2026)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Context Consistency Learning via Sentence Removal for Semi-Supervised Video Paragraph Grounding
di: Zhong, Yaokun, et al.
Pubblicazione: (2025)
di: Zhong, Yaokun, et al.
Pubblicazione: (2025)
Explicit Relational Reasoning Network for Scene Text Detection
di: Su, Yuchen, et al.
Pubblicazione: (2024)
di: Su, Yuchen, et al.
Pubblicazione: (2024)
Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context
di: Hu, JiaKui, et al.
Pubblicazione: (2026)
di: Hu, JiaKui, et al.
Pubblicazione: (2026)
NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning
di: Cai, Zhixi, et al.
Pubblicazione: (2025)
di: Cai, Zhixi, et al.
Pubblicazione: (2025)
The Escalator Problem: Identifying Implicit Motion Blindness in AI for Accessibility
di: Zhang, Xiantao
Pubblicazione: (2025)
di: Zhang, Xiantao
Pubblicazione: (2025)
Cross-Level Multi-Instance Distillation for Self-Supervised Fine-Grained Visual Categorization
di: Bi, Qi, et al.
Pubblicazione: (2024)
di: Bi, Qi, et al.
Pubblicazione: (2024)
Good Deep Features to Track: Self-Supervised Feature Extraction and Tracking in Visual Odometry
di: Gottam, Sai Puneeth Reddy, et al.
Pubblicazione: (2025)
di: Gottam, Sai Puneeth Reddy, et al.
Pubblicazione: (2025)
Exploring Reliable Spatiotemporal Dependencies for Efficient Visual Tracking
di: Shi, Junze, et al.
Pubblicazione: (2026)
di: Shi, Junze, et al.
Pubblicazione: (2026)
Context-Aware Integration of Language and Visual References for Natural Language Tracking
di: Shao, Yanyan, et al.
Pubblicazione: (2024)
di: Shao, Yanyan, et al.
Pubblicazione: (2024)
Instance-level Visual Active Tracking with Occlusion-Aware Planning
di: Sun, Haowei, et al.
Pubblicazione: (2026)
di: Sun, Haowei, et al.
Pubblicazione: (2026)
Enjoying Information Dividend: Gaze Track-based Medical Weakly Supervised Segmentation
di: Wang, Zhisong, et al.
Pubblicazione: (2025)
di: Wang, Zhisong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Explicit Visual Prompts for Visual Object Tracking
di: Shi, Liangtao, et al.
Pubblicazione: (2024) -
Adaptive Perception for Unified Visual Multi-modal Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2025) -
Learning to Track Instance from Single Nature Language Description
di: Zheng, Yaozong, et al.
Pubblicazione: (2026) -
An Efficient Token Compression Framework for Visual Object Tracking
di: Wu, Weijing, et al.
Pubblicazione: (2026) -
Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers
di: Xie, Jinxia, et al.
Pubblicazione: (2024)