TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
Fuente:
arXiv
Saved in:
| Main Authors: | Qu, Jinyuan, Li, Hongyang, Liu, Shilong, Ren, Tianhe, Zeng, Zhaoyang, Zhang, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
by: Li, Hongyang, et al.
Published: (2024)
by: Li, Hongyang, et al.
Published: (2024)
TAPTR: Tracking Any Point with Transformers as Detection
by: Li, Hongyang, et al.
Published: (2024)
by: Li, Hongyang, et al.
Published: (2024)
SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features
by: Qu, Jinyuan, et al.
Published: (2025)
by: Qu, Jinyuan, et al.
Published: (2025)
Referring to Any Person
by: Jiang, Qing, et al.
Published: (2025)
by: Jiang, Qing, et al.
Published: (2025)
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
by: Jiang, Qing, et al.
Published: (2024)
by: Jiang, Qing, et al.
Published: (2024)
OVSeg3R: Learn Open-vocabulary Instance Segmentation from 2D via 3D Reconstruction
by: Li, Hongyang, et al.
Published: (2025)
by: Li, Hongyang, et al.
Published: (2025)
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images
by: Qu, Jinyuan, et al.
Published: (2026)
by: Qu, Jinyuan, et al.
Published: (2026)
Detect Anything via Next Point Prediction
by: Jiang, Qing, et al.
Published: (2025)
by: Jiang, Qing, et al.
Published: (2025)
MV-TAP: Tracking Any Point in Multi-View Videos
by: Koo, Jahyeok, et al.
Published: (2025)
by: Koo, Jahyeok, et al.
Published: (2025)
Point Tracking as a Temporal Cue for Robust Myocardial Segmentation in Echocardiography Videos
by: Khodabakhshian, Bahar, et al.
Published: (2026)
by: Khodabakhshian, Bahar, et al.
Published: (2026)
LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry
by: Chen, Weirong, et al.
Published: (2024)
by: Chen, Weirong, et al.
Published: (2024)
Single-Model and Any-Modality for Video Object Tracking
by: Wu, Zongwei, et al.
Published: (2023)
by: Wu, Zongwei, et al.
Published: (2023)
Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
by: Shen, Cuifeng, et al.
Published: (2025)
by: Shen, Cuifeng, et al.
Published: (2025)
TAPIP3D: Tracking Any Point in Persistent 3D Geometry
by: Zhang, Bowei, et al.
Published: (2025)
by: Zhang, Bowei, et al.
Published: (2025)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
by: Liu, Shilong, et al.
Published: (2023)
by: Liu, Shilong, et al.
Published: (2023)
TAPVid-360: Tracking Any Point in 360 from Narrow Field of View Video
by: Hudson, Finlay G. C., et al.
Published: (2025)
by: Hudson, Finlay G. C., et al.
Published: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
by: Li, Aiden Yiliu, et al.
Published: (2025)
by: Li, Aiden Yiliu, et al.
Published: (2025)
Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
by: Ren, Tianhe, et al.
Published: (2024)
by: Ren, Tianhe, et al.
Published: (2024)
Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark
by: Zhou, Rulin, et al.
Published: (2025)
by: Zhou, Rulin, et al.
Published: (2025)
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
by: Jiang, Qing, et al.
Published: (2024)
by: Jiang, Qing, et al.
Published: (2024)
Tracking Any Point Methods for Markerless 3D Tissue Tracking in Endoscopic Stereo Images
by: Reuter, Konrad, et al.
Published: (2025)
by: Reuter, Konrad, et al.
Published: (2025)
TAPNext++: What's Next for Tracking Any Point (TAP)?
by: Jung, Sebastian, et al.
Published: (2026)
by: Jung, Sebastian, et al.
Published: (2026)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
by: Bian, Yuxuan, et al.
Published: (2025)
by: Bian, Yuxuan, et al.
Published: (2025)
MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models
by: Liu, Jiuming, et al.
Published: (2024)
by: Liu, Jiuming, et al.
Published: (2024)
Repurposing Video Diffusion Transformers for Robust Point Tracking
by: Son, Soowon, et al.
Published: (2025)
by: Son, Soowon, et al.
Published: (2025)
SpatialTracker: Tracking Any 2D Pixels in 3D Space
by: Xiao, Yuxi, et al.
Published: (2024)
by: Xiao, Yuxi, et al.
Published: (2024)
DATAP-SfM: Dynamic-Aware Tracking Any Point for Robust Structure from Motion in the Wild
by: Ye, Weicai, et al.
Published: (2024)
by: Ye, Weicai, et al.
Published: (2024)
Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
by: Li, Ruibin, et al.
Published: (2026)
by: Li, Ruibin, et al.
Published: (2026)
TAPNext: Tracking Any Point (TAP) as Next Token Prediction
by: Zholus, Artem, et al.
Published: (2025)
by: Zholus, Artem, et al.
Published: (2025)
Self-Supervised Any-Point Tracking by Contrastive Random Walks
by: Shrivastava, Ayush, et al.
Published: (2024)
by: Shrivastava, Ayush, et al.
Published: (2024)
Tracking Any Point with Frame-Event Fusion Network at High Frame Rate
by: Liu, Jiaxiong, et al.
Published: (2024)
by: Liu, Jiaxiong, et al.
Published: (2024)
TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
by: Wang, Mengmeng, et al.
Published: (2025)
by: Wang, Mengmeng, et al.
Published: (2025)
Stereo Any Video: Temporally Consistent Stereo Matching
by: Jing, Junpeng, et al.
Published: (2025)
by: Jing, Junpeng, et al.
Published: (2025)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
by: Cao, Siyu, et al.
Published: (2026)
by: Cao, Siyu, et al.
Published: (2026)
Track Any Anomalous Object: A Granular Video Anomaly Detection Pipeline
by: Huang, Yuzhi, et al.
Published: (2025)
by: Huang, Yuzhi, et al.
Published: (2025)
ETAP: Event-based Tracking of Any Point
by: Hamann, Friedhelm, et al.
Published: (2024)
by: Hamann, Friedhelm, et al.
Published: (2024)
BootsTAP: Bootstrapped Training for Tracking-Any-Point
by: Doersch, Carl, et al.
Published: (2024)
by: Doersch, Carl, et al.
Published: (2024)
ProTracker: Probabilistic Integration for Robust and Accurate Point Tracking
by: Zhang, Tingyang, et al.
Published: (2025)
by: Zhang, Tingyang, et al.
Published: (2025)
VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos
by: Liu, Pengyiang, et al.
Published: (2026)
by: Liu, Pengyiang, et al.
Published: (2026)
GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking
by: Bian, Weikang, et al.
Published: (2025)
by: Bian, Weikang, et al.
Published: (2025)
Similar Items
-
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
by: Li, Hongyang, et al.
Published: (2024) -
TAPTR: Tracking Any Point with Transformers as Detection
by: Li, Hongyang, et al.
Published: (2024) -
SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features
by: Qu, Jinyuan, et al.
Published: (2025) -
Referring to Any Person
by: Jiang, Qing, et al.
Published: (2025) -
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
by: Jiang, Qing, et al.
Published: (2024)