Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lv, Weiyi, Zhang, Ning, Sun, Hanyang, Jiang, Haoran, Zhao, Kai, Xiao, Jing, Zeng, Dan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cognitive Disentanglement for Referring Multi-Object Tracking
by: Liang, Shaofeng, et al.
Published: (2025)
by: Liang, Shaofeng, et al.
Published: (2025)
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again
by: Li, Weize, et al.
Published: (2025)
by: Li, Weize, et al.
Published: (2025)
Bootstrapping Referring Multi-Object Tracking
by: Zhang, Yani, et al.
Published: (2024)
by: Zhang, Yani, et al.
Published: (2024)
AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios
by: Chen, Chenglizhao, et al.
Published: (2025)
by: Chen, Chenglizhao, et al.
Published: (2025)
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
by: Chamiti, Tzoulio, et al.
Published: (2025)
by: Chamiti, Tzoulio, et al.
Published: (2025)
Cross-View Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2024)
by: Chen, Sijia, et al.
Published: (2024)
COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking
by: Jia, Shukun, et al.
Published: (2026)
by: Jia, Shukun, et al.
Published: (2026)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
by: Xiao, Changcheng, et al.
Published: (2024)
by: Xiao, Changcheng, et al.
Published: (2024)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
by: Zhang, Chunhui, et al.
Published: (2023)
by: Zhang, Chunhui, et al.
Published: (2023)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
by: Ding, Henghui, et al.
Published: (2025)
by: Ding, Henghui, et al.
Published: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
by: Sun, Baoli, et al.
Published: (2025)
by: Sun, Baoli, et al.
Published: (2025)
MEX: Memory-efficient Approach to Referring Multi-Object Tracking
by: Tran, Huu-Thien, et al.
Published: (2025)
by: Tran, Huu-Thien, et al.
Published: (2025)
STORM: End-to-End Referring Multi-Object Tracking in Videos
by: Lu, Zijia, et al.
Published: (2026)
by: Lu, Zijia, et al.
Published: (2026)
ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2026)
by: Chen, Sijia, et al.
Published: (2026)
Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking
by: Huang, Wenjun, et al.
Published: (2024)
by: Huang, Wenjun, et al.
Published: (2024)
EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving
by: Lin, Jiacheng, et al.
Published: (2024)
by: Lin, Jiacheng, et al.
Published: (2024)
Referring Video Object Segmentation via Language-aligned Track Selection
by: Kim, Seongchan, et al.
Published: (2024)
by: Kim, Seongchan, et al.
Published: (2024)
DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2026)
by: Chen, Sijia, et al.
Published: (2026)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
by: Chen, Yi-Chia, et al.
Published: (2024)
by: Chen, Yi-Chia, et al.
Published: (2024)
Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking
by: Wang, Shilei, et al.
Published: (2026)
by: Wang, Shilei, et al.
Published: (2026)
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
by: Yu, Yanqiu, et al.
Published: (2026)
by: Yu, Yanqiu, et al.
Published: (2026)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
by: Jiang, Haichao, et al.
Published: (2026)
by: Jiang, Haichao, et al.
Published: (2026)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
by: Wang, Xinyi, et al.
Published: (2025)
by: Wang, Xinyi, et al.
Published: (2025)
UCMCTrack: Multi-Object Tracking with Uniform Camera Motion Compensation
by: Yi, Kefu, et al.
Published: (2023)
by: Yi, Kefu, et al.
Published: (2023)
ModalChorus: Visual Probing and Alignment of Multi-modal Embeddings via Modal Fusion Map
by: Ye, Yilin, et al.
Published: (2024)
by: Ye, Yilin, et al.
Published: (2024)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
by: Ma, Zehong, et al.
Published: (2024)
by: Ma, Zehong, et al.
Published: (2024)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
by: Choi, Sun-Hyuk, et al.
Published: (2025)
by: Choi, Sun-Hyuk, et al.
Published: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
by: Jiang, Qing, et al.
Published: (2025)
by: Jiang, Qing, et al.
Published: (2025)
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching
by: Liu, Heng, et al.
Published: (2025)
by: Liu, Heng, et al.
Published: (2025)
DiffMOT: A Real-time Diffusion-based Multiple Object Tracker with Non-linear Prediction
by: Lv, Weiyi, et al.
Published: (2024)
by: Lv, Weiyi, et al.
Published: (2024)
Motion-Aware Transformer for Multi-Object Tracking
by: Yang, Xu, et al.
Published: (2025)
by: Yang, Xu, et al.
Published: (2025)
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
by: Liu, Taorong, et al.
Published: (2023)
by: Liu, Taorong, et al.
Published: (2023)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
by: Truong, Thanh-Dat, et al.
Published: (2025)
by: Truong, Thanh-Dat, et al.
Published: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
by: Liao, Pan, et al.
Published: (2026)
by: Liao, Pan, et al.
Published: (2026)
DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
by: Li, Weiran, et al.
Published: (2025)
by: Li, Weiran, et al.
Published: (2025)
MMTryon: Multi-Modal Multi-Reference Control for High-Quality Fashion Generation
by: Zhang, Xujie, et al.
Published: (2024)
by: Zhang, Xujie, et al.
Published: (2024)
PlugTrack: Multi-Perceptive Motion Analysis for Adaptive Fusion in Multi-Object Tracking
by: Kim, Seungjae, et al.
Published: (2025)
by: Kim, Seungjae, et al.
Published: (2025)
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding
by: Guo, Hao, et al.
Published: (2025)
by: Guo, Hao, et al.
Published: (2025)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
by: Hou, Xiaojun, et al.
Published: (2024)
by: Hou, Xiaojun, et al.
Published: (2024)
WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural Language
by: Lin, Zhenxiang, et al.
Published: (2023)
by: Lin, Zhenxiang, et al.
Published: (2023)
Similar Items
-
Cognitive Disentanglement for Referring Multi-Object Tracking
by: Liang, Shaofeng, et al.
Published: (2025) -
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again
by: Li, Weize, et al.
Published: (2025) -
Bootstrapping Referring Multi-Object Tracking
by: Zhang, Yani, et al.
Published: (2024) -
AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios
by: Chen, Chenglizhao, et al.
Published: (2025) -
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
by: Chamiti, Tzoulio, et al.
Published: (2025)