SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
Fuente:
arXiv
Saved in:
| Main Authors: | Hou, Xiaojun, Xing, Jiazheng, Qian, Yijie, Guo, Yaowei, Xin, Shuo, Chen, Junhao, Tang, Kai, Wang, Mengmeng, Jiang, Zhengkai, Liu, Liang, Liu, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Visual Object Tracking across Diverse Data Modalities: A Review
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion
by: Guo, Yaowei, et al.
Published: (2025)
by: Guo, Yaowei, et al.
Published: (2025)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
by: Xing, Jiazheng, et al.
Published: (2024)
by: Xing, Jiazheng, et al.
Published: (2024)
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
by: Tang, Zhangyong, et al.
Published: (2025)
by: Tang, Zhangyong, et al.
Published: (2025)
DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
by: Li, Weiran, et al.
Published: (2025)
by: Li, Weiran, et al.
Published: (2025)
X Modality Assisting RGBT Object Tracking
by: Ding, Zhaisheng, et al.
Published: (2023)
by: Ding, Zhaisheng, et al.
Published: (2023)
Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs
by: Xing, Jiazheng, et al.
Published: (2026)
by: Xing, Jiazheng, et al.
Published: (2026)
DM-Adapter: Domain-Aware Mixture-of-Adapters for Text-Based Person Retrieval
by: Liu, Yating, et al.
Published: (2025)
by: Liu, Yating, et al.
Published: (2025)
Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking
by: Zhu, Yabin, et al.
Published: (2026)
by: Zhu, Yabin, et al.
Published: (2026)
Omni Survey for Multimodality Analysis in Visual Object Tracking
by: Tang, Zhangyong, et al.
Published: (2025)
by: Tang, Zhangyong, et al.
Published: (2025)
Multi-Modal Dataset Distillation in the Wild
by: Dang, Zhuohang, et al.
Published: (2025)
by: Dang, Zhuohang, et al.
Published: (2025)
Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking
by: Chen, Xin, et al.
Published: (2023)
by: Chen, Xin, et al.
Published: (2023)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
by: Li, Yidi, et al.
Published: (2024)
by: Li, Yidi, et al.
Published: (2024)
SwiTrack: Tri-State Switch for Cross-Modal Object Tracking
by: Xu, Boyue, et al.
Published: (2025)
by: Xu, Boyue, et al.
Published: (2025)
Hyperspectral Adapter for Object Tracking based on Hyperspectral Video
by: Gao, Long, et al.
Published: (2025)
by: Gao, Long, et al.
Published: (2025)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
by: Wang, Qijie, et al.
Published: (2024)
by: Wang, Qijie, et al.
Published: (2024)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
by: Zhu, Deyi, et al.
Published: (2026)
by: Zhu, Deyi, et al.
Published: (2026)
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
by: Luo, Mingshuang, et al.
Published: (2026)
by: Luo, Mingshuang, et al.
Published: (2026)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
by: Yang, Cheng-Yen, et al.
Published: (2025)
by: Yang, Cheng-Yen, et al.
Published: (2025)
On Modality Incomplete Infrared-Visible Object Detection: An Architecture Compatibility Perspective
by: Yang, Shuo, et al.
Published: (2025)
by: Yang, Shuo, et al.
Published: (2025)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
by: Xing, Jiazheng, et al.
Published: (2023)
by: Xing, Jiazheng, et al.
Published: (2023)
Cross Fusion RGB-T Tracking with Bi-directional Adapter
by: Zeng, Zhirong, et al.
Published: (2024)
by: Zeng, Zhirong, et al.
Published: (2024)
1st Place Solution for MOSE Track in CVPR 2024 PVUW Workshop: Complex Video Object Segmentation
by: Miao, Deshui, et al.
Published: (2024)
by: Miao, Deshui, et al.
Published: (2024)
Towards Symmetric Low-Rank Adapters
by: Panoutsos, Tales, et al.
Published: (2025)
by: Panoutsos, Tales, et al.
Published: (2025)
VastTrack: Vast Category Visual Object Tracking
by: Peng, Liang, et al.
Published: (2024)
by: Peng, Liang, et al.
Published: (2024)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
by: Zhou, Ziheng, et al.
Published: (2024)
by: Zhou, Ziheng, et al.
Published: (2024)
Learning Frequency and Memory-Aware Prompts for Multi-Modal Object Tracking
by: Xu, Boyue, et al.
Published: (2025)
by: Xu, Boyue, et al.
Published: (2025)
iDAT: inverse Distillation Adapter-Tuning
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Smooth and Stepwise Self-Distillation for Object Detection
by: Deng, Jieren, et al.
Published: (2023)
by: Deng, Jieren, et al.
Published: (2023)
Object Isolated Attention for Consistent Story Visualization
by: Luo, Xiangyang, et al.
Published: (2025)
by: Luo, Xiangyang, et al.
Published: (2025)
TrackingMiM: Efficient Mamba-in-Mamba Serialization for Real-time UAV Object Tracking
by: Liu, Bingxi, et al.
Published: (2025)
by: Liu, Bingxi, et al.
Published: (2025)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
by: Zhao, Yumiao, et al.
Published: (2024)
by: Zhao, Yumiao, et al.
Published: (2024)
Optimal Transport Adapter Tuning for Bridging Modality Gaps in Few-Shot Remote Sensing Scene Classification
by: Ji, Zhong, et al.
Published: (2025)
by: Ji, Zhong, et al.
Published: (2025)
Inductive Cognitive Diagnosis for Fast Student Learning in Web-Based Online Intelligent Education Systems
by: Liu, Shuo, et al.
Published: (2024)
by: Liu, Shuo, et al.
Published: (2024)
Normal Values for Atrial Deformation Measured by Feature‐Tracking Cardiac MRI: A Meta‐Analysis
by: Qiuyi Cai, et al.
Published: (2024)
by: Qiuyi Cai, et al.
Published: (2024)
Positive normalized solutions to a singular elliptic equation with a $L^2$-supercritical nonlinearity
by: Chen, Siyu, et al.
Published: (2026)
by: Chen, Siyu, et al.
Published: (2026)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
by: Deng, Jiajun, et al.
Published: (2025)
by: Deng, Jiajun, et al.
Published: (2025)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
by: Fang, Ziye, et al.
Published: (2023)
by: Fang, Ziye, et al.
Published: (2023)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
Modality-Guided Dynamic Graph Fusion and Temporal Diffusion for Self-Supervised RGB-T Tracking
by: Li, Shenglan, et al.
Published: (2025)
by: Li, Shenglan, et al.
Published: (2025)
Similar Items
-
Visual Object Tracking across Diverse Data Modalities: A Review
by: Wang, Mengmeng, et al.
Published: (2024) -
CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion
by: Guo, Yaowei, et al.
Published: (2025) -
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
by: Xing, Jiazheng, et al.
Published: (2024) -
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
by: Tang, Zhangyong, et al.
Published: (2025) -
DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
by: Li, Weiran, et al.
Published: (2025)