Bootstrapping Referring Multi-Object Tracking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yani, Wu, Dongming, Han, Wencheng, Dong, Xingping |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
par: Zhang, Yani, et autres
Publié: (2025)
par: Zhang, Yani, et autres
Publié: (2025)
Cognitive Disentanglement for Referring Multi-Object Tracking
par: Liang, Shaofeng, et autres
Publié: (2025)
par: Liang, Shaofeng, et autres
Publié: (2025)
Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware Diffusion
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
par: Zhai, Yukun, et autres
Publié: (2023)
par: Zhai, Yukun, et autres
Publié: (2023)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Learning Frequency and Memory-Aware Prompts for Multi-Modal Object Tracking
par: Xu, Boyue, et autres
Publié: (2025)
par: Xu, Boyue, et autres
Publié: (2025)
CroBIM-V: Memory-Quality Controlled Remote Sensing Referring Video Object Segmentation
par: Jiang, H., et autres
Publié: (2026)
par: Jiang, H., et autres
Publié: (2026)
From Web to Pixels: Bringing Agentic Search into Visual Perception
par: Yang, Bokang, et autres
Publié: (2026)
par: Yang, Bokang, et autres
Publié: (2026)
ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring
par: Niu, Tianhao, et autres
Publié: (2026)
par: Niu, Tianhao, et autres
Publié: (2026)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
SwiTrack: Tri-State Switch for Cross-Modal Object Tracking
par: Xu, Boyue, et autres
Publié: (2025)
par: Xu, Boyue, et autres
Publié: (2025)
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
par: Yang, Cunyuan, et autres
Publié: (2026)
par: Yang, Cunyuan, et autres
Publié: (2026)
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again
par: Li, Weize, et autres
Publié: (2025)
par: Li, Weize, et autres
Publié: (2025)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
par: Xiao, Changcheng, et autres
Publié: (2024)
par: Xiao, Changcheng, et autres
Publié: (2024)
mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs
par: Geigle, Gregor, et autres
Publié: (2023)
par: Geigle, Gregor, et autres
Publié: (2023)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
par: Lv, Weiyi, et autres
Publié: (2025)
par: Lv, Weiyi, et autres
Publié: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios
par: Chen, Chenglizhao, et autres
Publié: (2025)
par: Chen, Chenglizhao, et autres
Publié: (2025)
ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
Language Prompt for Autonomous Driving
par: Wu, Dongming, et autres
Publié: (2023)
par: Wu, Dongming, et autres
Publié: (2023)
Cross-View Referring Multi-Object Tracking
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
DeconfuseTrack:Dealing with Confusion for Multi-Object Tracking
par: Huang, Cheng, et autres
Publié: (2024)
par: Huang, Cheng, et autres
Publié: (2024)
Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations
par: Pang, Wei, et autres
Publié: (2024)
par: Pang, Wei, et autres
Publié: (2024)
Hybrid-SORT: Weak Cues Matter for Online Multi-Object Tracking
par: Yang, Mingzhan, et autres
Publié: (2023)
par: Yang, Mingzhan, et autres
Publié: (2023)
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
par: Chamiti, Tzoulio, et autres
Publié: (2025)
par: Chamiti, Tzoulio, et autres
Publié: (2025)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Beyond MOT: Semantic Multi-Object Tracking
par: Li, Yunhao, et autres
Publié: (2024)
par: Li, Yunhao, et autres
Publié: (2024)
Multi-State Tracker: Enhancing Efficient Object Tracking via Multi-State Specialization and Interaction
par: Wang, Shilei, et autres
Publié: (2025)
par: Wang, Shilei, et autres
Publié: (2025)
QASA: Quality-Guided K-Adaptive Slot Attention for Unsupervised Object-Centric Learning
par: Ouyang, Tianran, et autres
Publié: (2026)
par: Ouyang, Tianran, et autres
Publié: (2026)
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
Spatial Semantic Recurrent Mining for Referring Image Segmentation
par: Yang, Jiaxing, et autres
Publié: (2024)
par: Yang, Jiaxing, et autres
Publié: (2024)
COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking
par: Jia, Shukun, et autres
Publié: (2026)
par: Jia, Shukun, et autres
Publié: (2026)
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
par: Yu, Yanqiu, et autres
Publié: (2026)
par: Yu, Yanqiu, et autres
Publié: (2026)
Joint Counting, Detection and Re-Identification for Multi-Object Tracking
par: Ren, Weihong, et autres
Publié: (2022)
par: Ren, Weihong, et autres
Publié: (2022)
Collaborative Multi-Object Tracking with Conformal Uncertainty Propagation
par: Su, Sanbao, et autres
Publié: (2023)
par: Su, Sanbao, et autres
Publié: (2023)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
Representation Alignment Contrastive Regularization for Multi-Object Tracking
par: Liu, Zhonglin, et autres
Publié: (2024)
par: Liu, Zhonglin, et autres
Publié: (2024)
MEX: Memory-efficient Approach to Referring Multi-Object Tracking
par: Tran, Huu-Thien, et autres
Publié: (2025)
par: Tran, Huu-Thien, et autres
Publié: (2025)
Documents similaires
-
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
par: Zhang, Yani, et autres
Publié: (2025) -
Cognitive Disentanglement for Referring Multi-Object Tracking
par: Liang, Shaofeng, et autres
Publié: (2025) -
Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware Diffusion
par: Wei, Haoran, et autres
Publié: (2024) -
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
par: Zhai, Yukun, et autres
Publié: (2023) -
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)