Tracking and Understanding Object Transformations
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Yihong, Yang, Xinyu, Sun, Jennifer J., Hariharan, Bharath |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
by: Sun, Yihong, et al.
Published: (2024)
by: Sun, Yihong, et al.
Published: (2024)
Live Interactive Training for Video Segmentation
by: Yang, Xinyu, et al.
Published: (2026)
by: Yang, Xinyu, et al.
Published: (2026)
Video Creation by Demonstration
by: Sun, Yihong, et al.
Published: (2024)
by: Sun, Yihong, et al.
Published: (2024)
Target-aware Bidirectional Fusion Transformer for Aerial Object Tracking
by: Sun, Xinglong, et al.
Published: (2025)
by: Sun, Xinglong, et al.
Published: (2025)
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
by: Peng, Wenxuan, et al.
Published: (2026)
by: Peng, Wenxuan, et al.
Published: (2026)
Learning Feature Descriptors using Camera Pose Supervision
by: Wang, Qianqian, et al.
Published: (2020)
by: Wang, Qianqian, et al.
Published: (2020)
ObjectCarver: Semi-automatic segmentation, reconstruction and separation of 3D objects
by: Hassena, Gemmechu, et al.
Published: (2024)
by: Hassena, Gemmechu, et al.
Published: (2024)
Motion-Aware Transformer for Multi-Object Tracking
by: Yang, Xu, et al.
Published: (2025)
by: Yang, Xu, et al.
Published: (2025)
C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
by: Huang, Kuan Wei, et al.
Published: (2025)
by: Huang, Kuan Wei, et al.
Published: (2025)
General Compression Framework for Efficient Transformer Object Tracking
by: Hong, Lingyi, et al.
Published: (2024)
by: Hong, Lingyi, et al.
Published: (2024)
Color Bind: Exploring Color Perception in Text-to-Image Models
by: Shomer-Chai, Shay, et al.
Published: (2025)
by: Shomer-Chai, Shay, et al.
Published: (2025)
Learning 3D Perception from Others' Predictions
by: Yoo, Jinsu, et al.
Published: (2024)
by: Yoo, Jinsu, et al.
Published: (2024)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
by: Shaar, Shaden, et al.
Published: (2026)
by: Shaar, Shaden, et al.
Published: (2026)
Lost and Found: Overcoming Detector Failures in Online Multi-Object Tracking
by: Vaquero, Lorenzo, et al.
Published: (2024)
by: Vaquero, Lorenzo, et al.
Published: (2024)
Tracking Transforming Objects: A Benchmark
by: Wu, You, et al.
Published: (2024)
by: Wu, You, et al.
Published: (2024)
On the Feasibility and Opportunity of Autoregressive 3D Object Detection
by: Huang, Zanming, et al.
Published: (2026)
by: Huang, Zanming, et al.
Published: (2026)
MONITRS: Multimodal Observations of Natural Incidents Through Remote Sensing
by: Revankar, Shreelekha, et al.
Published: (2025)
by: Revankar, Shreelekha, et al.
Published: (2025)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
by: Chetan, Aditya, et al.
Published: (2026)
by: Chetan, Aditya, et al.
Published: (2026)
Scale-Aware Recognition in Satellite Images under Resource Constraints
by: Revankar, Shreelekha, et al.
Published: (2024)
by: Revankar, Shreelekha, et al.
Published: (2024)
From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking
by: Shao, Yuqing, et al.
Published: (2025)
by: Shao, Yuqing, et al.
Published: (2025)
Exploring Dynamic Transformer for Efficient Object Tracking
by: Zhu, Jiawen, et al.
Published: (2024)
by: Zhu, Jiawen, et al.
Published: (2024)
Contrastive Learning for Multi-Object Tracking with Transformers
by: De Plaen, Pierre-François, et al.
Published: (2023)
by: De Plaen, Pierre-François, et al.
Published: (2023)
DeTrack: In-model Latent Denoising Learning for Visual Object Tracking
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
GTA: Global Tracklet Association for Multi-Object Tracking in Sports
by: Sun, Jiacheng, et al.
Published: (2024)
by: Sun, Jiacheng, et al.
Published: (2024)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
by: Xiao, Changcheng, et al.
Published: (2024)
by: Xiao, Changcheng, et al.
Published: (2024)
Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos
by: Ma, Jianbo, et al.
Published: (2025)
by: Ma, Jianbo, et al.
Published: (2025)
FastTrackTr:Towards Fast Multi-Object Tracking with Transformers
by: Liao, Pan, et al.
Published: (2024)
by: Liao, Pan, et al.
Published: (2024)
FreqTrack: Frequency Learning based Vision Transformer for RGB-Event Object Tracking
by: You, Jinlin, et al.
Published: (2026)
by: You, Jinlin, et al.
Published: (2026)
DiffusionTrack: Diffusion Model For Multi-Object Tracking
by: Luo, Run, et al.
Published: (2023)
by: Luo, Run, et al.
Published: (2023)
Cognitive Disentanglement for Referring Multi-Object Tracking
by: Liang, Shaofeng, et al.
Published: (2025)
by: Liang, Shaofeng, et al.
Published: (2025)
TrackNetV5: Residual-Driven Spatio-Temporal Refinement and Motion Direction Decoupling for Fast Object Tracking
by: Tang, Haonan, et al.
Published: (2025)
by: Tang, Haonan, et al.
Published: (2025)
FlashDepth: Real-time Streaming Video Depth Estimation at 2K Resolution
by: Chou, Gene, et al.
Published: (2025)
by: Chou, Gene, et al.
Published: (2025)
MegaScenes: Scene-Level View Synthesis at Scale
by: Tung, Joseph, et al.
Published: (2024)
by: Tung, Joseph, et al.
Published: (2024)
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
How Can Objects Help Video-Language Understanding?
by: Tang, Zitian, et al.
Published: (2025)
by: Tang, Zitian, et al.
Published: (2025)
Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens
by: Sun, Dengdi, et al.
Published: (2024)
by: Sun, Dengdi, et al.
Published: (2024)
Reliable Object Tracking by Multimodal Hybrid Feature Extraction and Transformer-Based Fusion
by: Sun, Hongze, et al.
Published: (2024)
by: Sun, Hongze, et al.
Published: (2024)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
by: Li, Yuhao, et al.
Published: (2024)
by: Li, Yuhao, et al.
Published: (2024)
History-Aware Transformation of ReID Features for Multiple Object Tracking
by: Gao, Ruopeng, et al.
Published: (2025)
by: Gao, Ruopeng, et al.
Published: (2025)
SOTFormer: A Minimal Transformer for Unified Object Tracking and Trajectory Prediction
by: Dong, Zhongping, et al.
Published: (2025)
by: Dong, Zhongping, et al.
Published: (2025)
Similar Items
-
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
by: Sun, Yihong, et al.
Published: (2024) -
Live Interactive Training for Video Segmentation
by: Yang, Xinyu, et al.
Published: (2026) -
Video Creation by Demonstration
by: Sun, Yihong, et al.
Published: (2024) -
Target-aware Bidirectional Fusion Transformer for Aerial Object Tracking
by: Sun, Xinglong, et al.
Published: (2025) -
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
by: Peng, Wenxuan, et al.
Published: (2026)