Tracking with Human-Intent Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Jiawen, Cheng, Zhi-Qi, He, Jun-Yan, Li, Chenyang, Luo, Bin, Lu, Huchuan, Geng, Yifeng, Xie, Xuansong |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Overcoming Topology Agnosticism: Enhancing Skeleton-Based Action Recognition through Redefined Skeletal Topology Awareness
by: Zhou, Yuxuan, et al.
Published: (2023)
by: Zhou, Yuxuan, et al.
Published: (2023)
Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation
by: Liu, Hanbing, et al.
Published: (2023)
by: Liu, Hanbing, et al.
Published: (2023)
DCPT: Darkness Clue-Prompted Tracking in Nighttime UAVs
by: Zhu, Jiawen, et al.
Published: (2023)
by: Zhu, Jiawen, et al.
Published: (2023)
Exploring Dynamic Transformer for Efficient Object Tracking
by: Zhu, Jiawen, et al.
Published: (2024)
by: Zhu, Jiawen, et al.
Published: (2024)
AnyText: Multilingual Visual Text Generation And Editing
by: Tuo, Yuxiang, et al.
Published: (2023)
by: Tuo, Yuxiang, et al.
Published: (2023)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
by: He, Junwen, et al.
Published: (2024)
by: He, Junwen, et al.
Published: (2024)
VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing
by: Chen, Binghui, et al.
Published: (2024)
by: Chen, Binghui, et al.
Published: (2024)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
by: He, Junwen, et al.
Published: (2024)
by: He, Junwen, et al.
Published: (2024)
ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion Model
by: Chen, Binghui, et al.
Published: (2024)
by: Chen, Binghui, et al.
Published: (2024)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
by: He, Jun-Yan, et al.
Published: (2024)
by: He, Jun-Yan, et al.
Published: (2024)
SUTrack: Towards Simple and Unified Single Object Tracking
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
Strictly-ID-Preserved and Controllable Accessory Advertising Image Generation
by: Xue, Youze, et al.
Published: (2024)
by: Xue, Youze, et al.
Published: (2024)
Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking
by: Chen, Xin, et al.
Published: (2023)
by: Chen, Xin, et al.
Published: (2023)
Two-stream Beats One-stream: Asymmetric Siamese Network for Efficient Visual Tracking
by: Zhu, Jiawen, et al.
Published: (2025)
by: Zhu, Jiawen, et al.
Published: (2025)
SRRT: Exploring Search Region Regulation for Visual Object Tracking
by: Zhu, Jiawen, et al.
Published: (2022)
by: Zhu, Jiawen, et al.
Published: (2022)
MambaVT: Spatio-Temporal Contextual Modeling for robust RGB-T Tracking
by: Lai, Simiao, et al.
Published: (2024)
by: Lai, Simiao, et al.
Published: (2024)
Hybrid-SORT: Weak Cues Matter for Online Multi-Object Tracking
by: Yang, Mingzhan, et al.
Published: (2023)
by: Yang, Mingzhan, et al.
Published: (2023)
UETrack: A Unified and Efficient Framework for Single Object Tracking
by: Kang, Ben, et al.
Published: (2026)
by: Kang, Ben, et al.
Published: (2026)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
by: Xiong, Haomiao, et al.
Published: (2025)
by: Xiong, Haomiao, et al.
Published: (2025)
UniPortrait: A Unified Framework for Identity-Preserving Single- and Multi-Human Image Personalization
by: He, Junjie, et al.
Published: (2024)
by: He, Junjie, et al.
Published: (2024)
X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification
by: Yu, Chenyang, et al.
Published: (2025)
by: Yu, Chenyang, et al.
Published: (2025)
EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively
by: Wang, Bingyang, et al.
Published: (2025)
by: Wang, Bingyang, et al.
Published: (2025)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
by: Diao, Haiwen, et al.
Published: (2024)
by: Diao, Haiwen, et al.
Published: (2024)
En3D: An Enhanced Generative Model for Sculpting 3D Humans from 2D Synthetic Data
by: Men, Yifang, et al.
Published: (2024)
by: Men, Yifang, et al.
Published: (2024)
Action Emergence from Streaming Intent
by: Jing, Pengfei, et al.
Published: (2026)
by: Jing, Pengfei, et al.
Published: (2026)
FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
by: Zhang, Lu, et al.
Published: (2025)
by: Zhang, Lu, et al.
Published: (2025)
AR-MOT: Autoregressive Multi-object Tracking
by: Jia, Lianjie, et al.
Published: (2026)
by: Jia, Lianjie, et al.
Published: (2026)
Towards Real-Time Open-Vocabulary Video Instance Segmentation
by: Yan, Bin, et al.
Published: (2024)
by: Yan, Bin, et al.
Published: (2024)
Efficient Motion Prompt Learning for Robust Visual Tracking
by: Zhao, Jie, et al.
Published: (2025)
by: Zhao, Jie, et al.
Published: (2025)
Fractal Characterization of Low-Correlation Signals in AI-Generated Image Detection
by: Xie, Wenwei, et al.
Published: (2026)
by: Xie, Wenwei, et al.
Published: (2026)
RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
by: Gong, Sitong, et al.
Published: (2025)
by: Gong, Sitong, et al.
Published: (2025)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
by: Xiong, Haomiao, et al.
Published: (2025)
by: Xiong, Haomiao, et al.
Published: (2025)
DiffusionGAN3D: Boosting Text-guided 3D Generation and Domain Adaptation by Combining 3D GANs and Diffusion Priors
by: Lei, Biwen, et al.
Published: (2023)
by: Lei, Biwen, et al.
Published: (2023)
Pixel-Aware Stable Diffusion for Realistic Image Super-resolution and Personalized Stylization
by: Yang, Tao, et al.
Published: (2023)
by: Yang, Tao, et al.
Published: (2023)
RobustMVS: Single Domain Generalized Deep Multi-view Stereo
by: Xu, Hongbin, et al.
Published: (2024)
by: Xu, Hongbin, et al.
Published: (2024)
DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception
by: Huang, Xiang, et al.
Published: (2024)
by: Huang, Xiang, et al.
Published: (2024)
Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation
by: Zhuge, Yunzhi, et al.
Published: (2025)
by: Zhuge, Yunzhi, et al.
Published: (2025)
Driving Intents Amplify Planning-Oriented Reinforcement Learning
by: Lu, Hengtong, et al.
Published: (2026)
by: Lu, Hengtong, et al.
Published: (2026)
DivAvatar: Diverse 3D Avatar Generation with a Single Prompt
by: Tao, Weijing, et al.
Published: (2024)
by: Tao, Weijing, et al.
Published: (2024)
Similar Items
-
Overcoming Topology Agnosticism: Enhancing Skeleton-Based Action Recognition through Redefined Skeletal Topology Awareness
by: Zhou, Yuxuan, et al.
Published: (2023) -
Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation
by: Liu, Hanbing, et al.
Published: (2023) -
DCPT: Darkness Clue-Prompted Tracking in Nighttime UAVs
by: Zhu, Jiawen, et al.
Published: (2023) -
Exploring Dynamic Transformer for Efficient Object Tracking
by: Zhu, Jiawen, et al.
Published: (2024) -
AnyText: Multilingual Visual Text Generation And Editing
by: Tuo, Yuxiang, et al.
Published: (2023)