VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Kui, Xu, Shuhang, Chen, Hao, Wang, Churan, Li, Zhoujun, Wang, Yizhou, Zhong, Fangwei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Hierarchical Instruction-aware Embodied Visual Tracking
by: Wu, Kui, et al.
Published: (2025)
by: Wu, Kui, et al.
Published: (2025)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
by: Zhong, Fangwei, et al.
Published: (2024)
by: Zhong, Fangwei, et al.
Published: (2024)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
by: Zhong, Fangwei, et al.
Published: (2024)
by: Zhong, Fangwei, et al.
Published: (2024)
RescueBench: Can Embodied Agents Save Lives in the Wild ?
by: Wu, Kui, et al.
Published: (2026)
by: Wu, Kui, et al.
Published: (2026)
Clinical Inspired MRI Lesion Segmentation
by: Yan, Lijun, et al.
Published: (2025)
by: Yan, Lijun, et al.
Published: (2025)
TrackVLA: Embodied Visual Tracking in the Wild
by: Wang, Shaoan, et al.
Published: (2025)
by: Wang, Shaoan, et al.
Published: (2025)
AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking
by: Wu, Kui, et al.
Published: (2026)
by: Wu, Kui, et al.
Published: (2026)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
by: Liu, Jiahang, et al.
Published: (2025)
by: Liu, Jiahang, et al.
Published: (2025)
Enhanced MRI Representation via Cross-series Masking
by: Wang, Churan, et al.
Published: (2024)
by: Wang, Churan, et al.
Published: (2024)
Cross-Dimensional Medical Self-Supervised Representation Learning Based on a Pseudo-3D Transformation
by: Gao, Fei, et al.
Published: (2024)
by: Gao, Fei, et al.
Published: (2024)
CRAVES: Controlling Robotic Arm with a Vision-based Economic System
by: Zuo, Yiming, et al.
Published: (2018)
by: Zuo, Yiming, et al.
Published: (2018)
Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
by: Huang, Yifei, et al.
Published: (2024)
by: Huang, Yifei, et al.
Published: (2024)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
by: Chu, Xiangxiang, et al.
Published: (2023)
by: Chu, Xiangxiang, et al.
Published: (2023)
Autoregressive Sequence Modeling for 3D Medical Image Representation
by: Wang, Siwen, et al.
Published: (2024)
by: Wang, Siwen, et al.
Published: (2024)
EmbRACE-3K: Embodied Reasoning and Action in Complex Environments
by: Lin, Mingxian, et al.
Published: (2025)
by: Lin, Mingxian, et al.
Published: (2025)
EgoSelf: From Memory to Personalized Egocentric Assistant
by: Wang, Yanshuo, et al.
Published: (2026)
by: Wang, Yanshuo, et al.
Published: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
by: Zhang, Qiyao, et al.
Published: (2026)
by: Zhang, Qiyao, et al.
Published: (2026)
RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes
by: Wu, Leyi, et al.
Published: (2026)
by: Wu, Leyi, et al.
Published: (2026)
VPTracker: Global Vision-Language Tracking via Visual Prompt
by: Wang, Jingchao, et al.
Published: (2025)
by: Wang, Jingchao, et al.
Published: (2025)
Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
by: Shen, Tiancheng, et al.
Published: (2024)
by: Shen, Tiancheng, et al.
Published: (2024)
Q-VLM: Post-training Quantization for Large Vision-Language Models
by: Wang, Changyuan, et al.
Published: (2024)
by: Wang, Changyuan, et al.
Published: (2024)
CogVLM: Visual Expert for Pretrained Language Models
by: Wang, Weihan, et al.
Published: (2023)
by: Wang, Weihan, et al.
Published: (2023)
Vision-Language Models Can Self-Improve Reasoning via Reflection
by: Cheng, Kanzhi, et al.
Published: (2024)
by: Cheng, Kanzhi, et al.
Published: (2024)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
by: Halacheva, Anna-Maria, et al.
Published: (2025)
by: Halacheva, Anna-Maria, et al.
Published: (2025)
NaturalVLM: Leveraging Fine-grained Natural Language for Affordance-Guided Visual Manipulation
by: Xu, Ran, et al.
Published: (2024)
by: Xu, Ran, et al.
Published: (2024)
VLM-based Prompts as the Optimal Assistant for Unpaired Histopathology Virtual Staining
by: Chen, Zizhi, et al.
Published: (2025)
by: Chen, Zizhi, et al.
Published: (2025)
Good Deep Features to Track: Self-Supervised Feature Extraction and Tracking in Visual Odometry
by: Gottam, Sai Puneeth Reddy, et al.
Published: (2025)
by: Gottam, Sai Puneeth Reddy, et al.
Published: (2025)
Confusing Pair Correction Based on Category Prototype for Domain Adaptation under Noisy Environments
by: Zhi, Churan, et al.
Published: (2024)
by: Zhi, Churan, et al.
Published: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
by: Feng, X., et al.
Published: (2024)
by: Feng, X., et al.
Published: (2024)
LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model
by: Wang, Ruosi, et al.
Published: (2026)
by: Wang, Ruosi, et al.
Published: (2026)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
by: Jin, Yizhang, et al.
Published: (2024)
by: Jin, Yizhang, et al.
Published: (2024)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
by: Zhang, Jiazhao, et al.
Published: (2024)
by: Zhang, Jiazhao, et al.
Published: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
by: Zhang, Yuan, et al.
Published: (2024)
by: Zhang, Yuan, et al.
Published: (2024)
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
by: Gao, Jianzhe, et al.
Published: (2026)
by: Gao, Jianzhe, et al.
Published: (2026)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
by: Sun, Guohao, et al.
Published: (2024)
by: Sun, Guohao, et al.
Published: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
by: Chen, Kaibing, et al.
Published: (2024)
by: Chen, Kaibing, et al.
Published: (2024)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
by: Yang, Ganlin, et al.
Published: (2025)
by: Yang, Ganlin, et al.
Published: (2025)
CoMet: Metaphor-Driven Covert Communication for Multi-Agent Language Games
by: Xu, Shuhang, et al.
Published: (2025)
by: Xu, Shuhang, et al.
Published: (2025)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
by: Ma, Yingzi, et al.
Published: (2025)
by: Ma, Yingzi, et al.
Published: (2025)
Similar Items
-
Hierarchical Instruction-aware Embodied Visual Tracking
by: Wu, Kui, et al.
Published: (2025) -
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
by: Zhong, Fangwei, et al.
Published: (2024) -
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
by: Zhong, Fangwei, et al.
Published: (2024) -
RescueBench: Can Embodied Agents Save Lives in the Wild ?
by: Wu, Kui, et al.
Published: (2026) -
Clinical Inspired MRI Lesion Segmentation
by: Yan, Lijun, et al.
Published: (2025)