GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Xingyu, Cai, Yidong, Liu, Jie, Tang, Jie, Wu, Gangshan, Wang, Limin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MixFormerV2: Efficient Fully Transformer Tracking
por: Cui, Yutao, et al.
Publicado: (2023)
por: Cui, Yutao, et al.
Publicado: (2023)
Pure-Pass: Fine-Grained, Adaptive Masking for Dynamic Token-Mixing Routing in Lightweight Image Super-Resolution
por: Wu, Junyu, et al.
Publicado: (2025)
por: Wu, Junyu, et al.
Publicado: (2025)
CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026)
por: Xu, Boyue, et al.
Publicado: (2026)
AnomalyR1: A GRPO-based End-to-end MLLM for Industrial Anomaly Detection
por: Chao, Yuhao, et al.
Publicado: (2025)
por: Chao, Yuhao, et al.
Publicado: (2025)
Open-Vocabulary Spatio-Temporal Action Detection
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
GLAD: Generalizable Tuning for Vision-Language Models
por: Peng, Yuqi, et al.
Publicado: (2025)
por: Peng, Yuqi, et al.
Publicado: (2025)
Sketch and Refine: Towards Fast and Accurate Lane Detection
por: Chen, Chao, et al.
Publicado: (2024)
por: Chen, Chao, et al.
Publicado: (2024)
MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
por: Zhu, Chenhui, et al.
Publicado: (2025)
por: Zhu, Chenhui, et al.
Publicado: (2025)
SportsHHI: A Dataset for Human-Human Interaction Detection in Sports Videos
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation
por: Zhu, Yuhan, et al.
Publicado: (2024)
por: Zhu, Yuhan, et al.
Publicado: (2024)
Joint Modeling of Feature, Correspondence, and a Compressed Memory for Video Object Segmentation
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation
por: Wang, Haonan, et al.
Publicado: (2024)
por: Wang, Haonan, et al.
Publicado: (2024)
Disentangled Textual Priors for Diffusion-based Image Super-Resolution
por: Jiang, Lei, et al.
Publicado: (2026)
por: Jiang, Lei, et al.
Publicado: (2026)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
por: Zhu, Deyi, et al.
Publicado: (2026)
por: Zhu, Deyi, et al.
Publicado: (2026)
STMixer: A One-Stage Sparse Action Detector
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
Dual DETRs for Multi-Label Temporal Action Detection
por: Zhu, Yuhan, et al.
Publicado: (2024)
por: Zhu, Yuhan, et al.
Publicado: (2024)
ObjFiller3D: Scaling 3D Object Inpainting to Dense Multi-View Consistency
por: Feng, Haitang, et al.
Publicado: (2025)
por: Feng, Haitang, et al.
Publicado: (2025)
AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual Learning
por: Xu, Yuheng, et al.
Publicado: (2025)
por: Xu, Yuheng, et al.
Publicado: (2025)
Efficient Test-Time Prompt Tuning for Vision-Language Models
por: Zhu, Yuhan, et al.
Publicado: (2024)
por: Zhu, Yuhan, et al.
Publicado: (2024)
SAM 2++: Tracking Anything at Any Granularity
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing
por: Pan, Tianrui, et al.
Publicado: (2025)
por: Pan, Tianrui, et al.
Publicado: (2025)
Towards General Multimodal Visual Tracking
por: Lu, Andong, et al.
Publicado: (2025)
por: Lu, Andong, et al.
Publicado: (2025)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
por: Zhao, Zhiyu, et al.
Publicado: (2023)
por: Zhao, Zhiyu, et al.
Publicado: (2023)
SwiTrack: Tri-State Switch for Cross-Modal Object Tracking
por: Xu, Boyue, et al.
Publicado: (2025)
por: Xu, Boyue, et al.
Publicado: (2025)
Efficient 4D Gaussian Stream with Low Rank Adaptation
por: Liu, Zhenhuan, et al.
Publicado: (2025)
por: Liu, Zhenhuan, et al.
Publicado: (2025)
GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection
por: Yao, Hang, et al.
Publicado: (2024)
por: Yao, Hang, et al.
Publicado: (2024)
HIPTrack: Visual Tracking with Historical Prompts
por: Cai, Wenrui, et al.
Publicado: (2023)
por: Cai, Wenrui, et al.
Publicado: (2023)
RGB-D Tracking via Hierarchical Modality Aggregation and Distribution Network
por: Xu, Boyue, et al.
Publicado: (2025)
por: Xu, Boyue, et al.
Publicado: (2025)
Learning Frequency and Memory-Aware Prompts for Multi-Modal Object Tracking
por: Xu, Boyue, et al.
Publicado: (2025)
por: Xu, Boyue, et al.
Publicado: (2025)
EmoAssist: Emotional Assistant for Visual Impairment Community
por: Qi, Xingyu, et al.
Publicado: (2025)
por: Qi, Xingyu, et al.
Publicado: (2025)
Parameterize Structure with Differentiable Template for 3D Shape Generation
por: Ma, Changfeng, et al.
Publicado: (2024)
por: Ma, Changfeng, et al.
Publicado: (2024)
Event Data Association via Robust Model Fitting for Event-based Object Tracking
por: Chen, Haosheng, et al.
Publicado: (2021)
por: Chen, Haosheng, et al.
Publicado: (2021)
Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking
por: Ge, Jiawei, et al.
Publicado: (2023)
por: Ge, Jiawei, et al.
Publicado: (2023)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
por: Wang, Shaoan, et al.
Publicado: (2026)
por: Wang, Shaoan, et al.
Publicado: (2026)
MeMOTR: Long-Term Memory-Augmented Transformer for Multi-Object Tracking
por: Gao, Ruopeng, et al.
Publicado: (2023)
por: Gao, Ruopeng, et al.
Publicado: (2023)
Efficient Motion Prompt Learning for Robust Visual Tracking
por: Zhao, Jie, et al.
Publicado: (2025)
por: Zhao, Jie, et al.
Publicado: (2025)
Open-Vocabulary Segmentation with Semantic-Assisted Calibration
por: Liu, Yong, et al.
Publicado: (2023)
por: Liu, Yong, et al.
Publicado: (2023)
Multiple Object Tracking as ID Prediction
por: Gao, Ruopeng, et al.
Publicado: (2024)
por: Gao, Ruopeng, et al.
Publicado: (2024)
History-Aware Transformation of ReID Features for Multiple Object Tracking
por: Gao, Ruopeng, et al.
Publicado: (2025)
por: Gao, Ruopeng, et al.
Publicado: (2025)
Ejemplares similares
-
MixFormerV2: Efficient Fully Transformer Tracking
por: Cui, Yutao, et al.
Publicado: (2023) -
Pure-Pass: Fine-Grained, Adaptive Masking for Dynamic Token-Mixing Routing in Lightweight Image Super-Resolution
por: Wu, Junyu, et al.
Publicado: (2025) -
CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution
por: Liu, Xin, et al.
Publicado: (2025) -
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026) -
AnomalyR1: A GRPO-based End-to-end MLLM for Industrial Anomaly Detection
por: Chao, Yuhao, et al.
Publicado: (2025)