Enhancing Self-Supervised Fine-Grained Video Object Tracking with Dynamic Memory Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Zihan, Dai, Changrui, Song, Aibo, Fang, Xiaolin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning
par: Zhou, Zihan, et autres
Publié: (2025)
par: Zhou, Zihan, et autres
Publié: (2025)
Enhanced Object Tracking by Self-Supervised Auxiliary Depth Estimation Learning
par: Wei, Zhenyu, et autres
Publié: (2024)
par: Wei, Zhenyu, et autres
Publié: (2024)
Dynamic Attention Mechanism in Spatiotemporal Memory Networks for Object Tracking
par: Zhou, Meng, et autres
Publié: (2025)
par: Zhou, Meng, et autres
Publié: (2025)
Self-Supervised Multi-Object Tracking with Path Consistency
par: Lu, Zijia, et autres
Publié: (2024)
par: Lu, Zijia, et autres
Publié: (2024)
Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
par: Zhang, Chenshuang, et autres
Publié: (2025)
par: Zhang, Chenshuang, et autres
Publié: (2025)
OCK: Unsupervised Dynamic Video Prediction with Object-Centric Kinematics
par: Song, Yeon-Ji, et autres
Publié: (2024)
par: Song, Yeon-Ji, et autres
Publié: (2024)
Towards Fine-Grained Human Motion Video Captioning
par: Song, Guorui, et autres
Publié: (2025)
par: Song, Guorui, et autres
Publié: (2025)
VOVTrack: Exploring the Potentiality in Videos for Open-Vocabulary Object Tracking
par: Qian, Zekun, et autres
Publié: (2024)
par: Qian, Zekun, et autres
Publié: (2024)
YOLO11-JDE: Fast and Accurate Multi-Object Tracking with Self-Supervised Re-ID
par: Erregue, Iñaki, et autres
Publié: (2025)
par: Erregue, Iñaki, et autres
Publié: (2025)
RMem: Restricted Memory Banks Improve Video Object Segmentation
par: Zhou, Junbao, et autres
Publié: (2024)
par: Zhou, Junbao, et autres
Publié: (2024)
A Self-Supervised Approach for Enhanced Feature Representations in Object Detection Tasks
par: Vilabella, Santiago C., et autres
Publié: (2026)
par: Vilabella, Santiago C., et autres
Publié: (2026)
Towards Fine-Grained Video Question Answering
par: Dai, Wei, et autres
Publié: (2025)
par: Dai, Wei, et autres
Publié: (2025)
MEX: Memory-efficient Approach to Referring Multi-Object Tracking
par: Tran, Huu-Thien, et autres
Publié: (2025)
par: Tran, Huu-Thien, et autres
Publié: (2025)
Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation
par: Pourmirzaei, Mahdi, et autres
Publié: (2021)
par: Pourmirzaei, Mahdi, et autres
Publié: (2021)
MAEPose: Self-Supervised Spatiotemporal Learning for Human Pose Estimation on mmWave Video
par: Wei, Xijia, et autres
Publié: (2026)
par: Wei, Xijia, et autres
Publié: (2026)
Self-Supervised Learning for Endoscopic Video Analysis
par: Hirsch, Roy, et autres
Publié: (2023)
par: Hirsch, Roy, et autres
Publié: (2023)
STORM: End-to-End Referring Multi-Object Tracking in Videos
par: Lu, Zijia, et autres
Publié: (2026)
par: Lu, Zijia, et autres
Publié: (2026)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024)
par: Chen, Houlun, et autres
Publié: (2024)
Embodied Uncertainty-Aware Object Segmentation
par: Fang, Xiaolin, et autres
Publié: (2024)
par: Fang, Xiaolin, et autres
Publié: (2024)
OCTrack: Benchmarking the Open-Corpus Multi-Object Tracking
par: Qian, Zekun, et autres
Publié: (2024)
par: Qian, Zekun, et autres
Publié: (2024)
Memory-Efficient Continual Learning Object Segmentation for Long Video
par: Nazemi, Amir, et autres
Publié: (2023)
par: Nazemi, Amir, et autres
Publié: (2023)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
par: Kim, Namho, et autres
Publié: (2025)
par: Kim, Namho, et autres
Publié: (2025)
DanceCrafter: Fine-Grained Text-Driven Controllable Dance Generation via Choreographic Syntax
par: Yuan, Hang, et autres
Publié: (2026)
par: Yuan, Hang, et autres
Publié: (2026)
Heterogeneous Graph Transformer for Multiple Tiny Object Tracking in RGB-T Videos
par: Xu, Qingyu, et autres
Publié: (2024)
par: Xu, Qingyu, et autres
Publié: (2024)
Mitigating Object Dependencies: Improving Point Cloud Self-Supervised Learning through Object Exchange
par: Wu, Yanhao, et autres
Publié: (2024)
par: Wu, Yanhao, et autres
Publié: (2024)
Awesome Multi-modal Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
par: Tao, Zhou, et autres
Publié: (2025)
par: Tao, Zhou, et autres
Publié: (2025)
FILA: Fine-Grained Vision Language Models
par: Zhu, Shiding, et autres
Publié: (2024)
par: Zhu, Shiding, et autres
Publié: (2024)
Static Segmentation by Tracking: A Label-Efficient Approach for Fine-Grained Specimen Image Segmentation
par: Feng, Zhenyang, et autres
Publié: (2025)
par: Feng, Zhenyang, et autres
Publié: (2025)
Toddlers' Active Gaze Behavior Supports Self-Supervised Object Learning
par: Yu, Zhengyang, et autres
Publié: (2024)
par: Yu, Zhengyang, et autres
Publié: (2024)
SAR Object Detection with Self-Supervised Pretraining and Curriculum-Aware Sampling
par: Almalioglu, Yasin, et autres
Publié: (2025)
par: Almalioglu, Yasin, et autres
Publié: (2025)
CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval
par: Qian, Zhipeng, et autres
Publié: (2026)
par: Qian, Zhipeng, et autres
Publié: (2026)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
par: Chen, Harold Haodong, et autres
Publié: (2024)
par: Chen, Harold Haodong, et autres
Publié: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
Leveraging Unknown Objects to Construct Labeled-Unlabeled Meta-Relationships for Zero-Shot Object Navigation
par: Zheng, Yanwei, et autres
Publié: (2024)
par: Zheng, Yanwei, et autres
Publié: (2024)
FILS: Self-Supervised Video Feature Prediction In Semantic Language Space
par: Ahmadian, Mona, et autres
Publié: (2024)
par: Ahmadian, Mona, et autres
Publié: (2024)
Feature-Enhanced TResNet for Fine-Grained Food Image Classification
par: Liu, Lulu, et autres
Publié: (2025)
par: Liu, Lulu, et autres
Publié: (2025)
Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking
par: Huang, Wenjun, et autres
Publié: (2024)
par: Huang, Wenjun, et autres
Publié: (2024)
Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
par: Chen, Kaijin, et autres
Publié: (2026)
par: Chen, Kaijin, et autres
Publié: (2026)
Documents similaires
-
Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning
par: Zhou, Zihan, et autres
Publié: (2025) -
Enhanced Object Tracking by Self-Supervised Auxiliary Depth Estimation Learning
par: Wei, Zhenyu, et autres
Publié: (2024) -
Dynamic Attention Mechanism in Spatiotemporal Memory Networks for Object Tracking
par: Zhou, Meng, et autres
Publié: (2025) -
Self-Supervised Multi-Object Tracking with Path Consistency
par: Lu, Zijia, et autres
Publié: (2024) -
Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
par: Zhang, Chenshuang, et autres
Publié: (2025)