ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
Fuente:
arXiv
Saved in:
| Main Authors: | Zhen, Yihao, Wang, Qiang, Qiao, Yu, Qu, Liangqiong, Fan, Huijie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Distribution-aware Forgetting Compensation for Exemplar-Free Lifelong Person Re-identification
by: Liu, Shiben, et al.
Published: (2025)
by: Liu, Shiben, et al.
Published: (2025)
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
by: Shi, Yanzhao, et al.
Published: (2025)
by: Shi, Yanzhao, et al.
Published: (2025)
See Detail Say Clear: Towards Brain CT Report Generation via Pathological Clue-driven Representation Learning
by: Zheng, Chengxin, et al.
Published: (2024)
by: Zheng, Chengxin, et al.
Published: (2024)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
by: Luo, Bingjun, et al.
Published: (2026)
by: Luo, Bingjun, et al.
Published: (2026)
DSKC: Domain Style Modeling with Adaptive Knowledge Consolidation for Exemplar-free Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2025)
by: Liu, Shiben, et al.
Published: (2025)
Unified Spatial-Temporal Edge-Enhanced Graph Networks for Pedestrian Trajectory Prediction
by: Li, Ruochen, et al.
Published: (2025)
by: Li, Ruochen, et al.
Published: (2025)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
by: Zhang, Fei, et al.
Published: (2025)
by: Zhang, Fei, et al.
Published: (2025)
GMT: Effective Global Framework for Multi-Camera Multi-Target Tracking
by: Zhen, Yihao, et al.
Published: (2024)
by: Zhen, Yihao, et al.
Published: (2024)
Residual Denoising Diffusion Models
by: Liu, Jiawei, et al.
Published: (2023)
by: Liu, Jiawei, et al.
Published: (2023)
Domain Consistency Representation Learning for Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2024)
by: Liu, Shiben, et al.
Published: (2024)
Diverse Representation Embedding for Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2024)
by: Liu, Shiben, et al.
Published: (2024)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
by: Wu, Junfei, et al.
Published: (2025)
by: Wu, Junfei, et al.
Published: (2025)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
by: Zheng, Xinyi, et al.
Published: (2026)
by: Zheng, Xinyi, et al.
Published: (2026)
STSA: Spatial-Temporal Semantic Alignment for Visual Dubbing
by: Ding, Zijun, et al.
Published: (2025)
by: Ding, Zijun, et al.
Published: (2025)
Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
by: Lu, Kaixuan, et al.
Published: (2024)
by: Lu, Kaixuan, et al.
Published: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
by: Ye, Zhipeng, et al.
Published: (2026)
by: Ye, Zhipeng, et al.
Published: (2026)
TMUAD: Enhancing Logical Capabilities in Unified Anomaly Detection Models with a Text Memory Bank
by: Liu, Jiawei, et al.
Published: (2025)
by: Liu, Jiawei, et al.
Published: (2025)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
by: Wu, Kui, et al.
Published: (2025)
by: Wu, Kui, et al.
Published: (2025)
Adversarial Attack for RGB-Event based Visual Object Tracking
by: Chen, Qiang, et al.
Published: (2025)
by: Chen, Qiang, et al.
Published: (2025)
NT-VOT211: A Large-Scale Benchmark for Night-time Visual Object Tracking
by: Liu, Yu, et al.
Published: (2024)
by: Liu, Yu, et al.
Published: (2024)
3D Single-object Tracking in Point Clouds with High Temporal Variation
by: Wu, Qiao, et al.
Published: (2024)
by: Wu, Qiao, et al.
Published: (2024)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
by: Li, Ruihang, et al.
Published: (2026)
by: Li, Ruihang, et al.
Published: (2026)
CrossVIT-augmented Geospatial-Intelligence Visualization System for Tracking Economic Development Dynamics
by: Bai, Yanbing, et al.
Published: (2024)
by: Bai, Yanbing, et al.
Published: (2024)
Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding
by: Patratskiy, Maxim A., et al.
Published: (2025)
by: Patratskiy, Maxim A., et al.
Published: (2025)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
by: Ju, Shaobo, et al.
Published: (2026)
by: Ju, Shaobo, et al.
Published: (2026)
M-Gaussian: An Magnetic Gaussian Framework for Efficient Multi-Stack MRI Reconstruction
by: Zheng, Kangyuan, et al.
Published: (2026)
by: Zheng, Kangyuan, et al.
Published: (2026)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
by: Mao, Jiawei, et al.
Published: (2025)
by: Mao, Jiawei, et al.
Published: (2025)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
by: Li, Weihong, et al.
Published: (2025)
by: Li, Weihong, et al.
Published: (2025)
CLDTracker: A Comprehensive Language Description for Visual Tracking
by: Alansari, Mohamad, et al.
Published: (2025)
by: Alansari, Mohamad, et al.
Published: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
by: Tong, Haoyu, et al.
Published: (2026)
by: Tong, Haoyu, et al.
Published: (2026)
Enhancing Spatial Reasoning through Visual and Textual Thinking
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models
by: Qu, Zhen, et al.
Published: (2026)
by: Qu, Zhen, et al.
Published: (2026)
Handling Spatial-Temporal Data Heterogeneity for Federated Continual Learning via Tail Anchor
by: Yu, Hao, et al.
Published: (2024)
by: Yu, Hao, et al.
Published: (2024)
Can Large Language Models Grasp Event Signals? Exploring Pure Zero-Shot Event-based Recognition
by: Yu, Zongyou, et al.
Published: (2024)
by: Yu, Zongyou, et al.
Published: (2024)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
by: Xie, Xing, et al.
Published: (2025)
by: Xie, Xing, et al.
Published: (2025)
One-Shot Action Recognition via Multi-Scale Spatial-Temporal Skeleton Matching
by: Yang, Siyuan, et al.
Published: (2023)
by: Yang, Siyuan, et al.
Published: (2023)
EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization
by: Wang, Xiaoqi, et al.
Published: (2025)
by: Wang, Xiaoqi, et al.
Published: (2025)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
by: Zhan, Yufei, et al.
Published: (2024)
by: Zhan, Yufei, et al.
Published: (2024)
TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting
by: Wu, Zhicong, et al.
Published: (2025)
by: Wu, Zhicong, et al.
Published: (2025)
Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy
by: Yang, Te, et al.
Published: (2024)
by: Yang, Te, et al.
Published: (2024)
Similar Items
-
Distribution-aware Forgetting Compensation for Exemplar-Free Lifelong Person Re-identification
by: Liu, Shiben, et al.
Published: (2025) -
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
by: Shi, Yanzhao, et al.
Published: (2025) -
See Detail Say Clear: Towards Brain CT Report Generation via Pathological Clue-driven Representation Learning
by: Zheng, Chengxin, et al.
Published: (2024) -
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
by: Luo, Bingjun, et al.
Published: (2026) -
DSKC: Domain Style Modeling with Adaptive Knowledge Consolidation for Exemplar-free Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2025)