TrackVLA: Embodied Visual Tracking in the Wild
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shaoan, Zhang, Jiazhao, Li, Minghan, Liu, Jiahang, Li, Anqi, Wu, Kui, Zhong, Fangwei, Yu, Junzhi, Zhang, Zhizheng, Wang, He |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
por: Liu, Jiahang, et al.
Publicado: (2025)
por: Liu, Jiahang, et al.
Publicado: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
por: Zhong, Fangwei, et al.
Publicado: (2024)
por: Zhong, Fangwei, et al.
Publicado: (2024)
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
por: Xu, Tianyu, et al.
Publicado: (2025)
por: Xu, Tianyu, et al.
Publicado: (2025)
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
por: Liu, Jiahang, et al.
Publicado: (2026)
por: Liu, Jiahang, et al.
Publicado: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
por: Zhang, Qiyao, et al.
Publicado: (2026)
por: Zhang, Qiyao, et al.
Publicado: (2026)
Hierarchical Instruction-aware Embodied Visual Tracking
por: Wu, Kui, et al.
Publicado: (2025)
por: Wu, Kui, et al.
Publicado: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
por: Wang, Shaoan, et al.
Publicado: (2026)
por: Wang, Shaoan, et al.
Publicado: (2026)
Embodied Navigation Foundation Model
por: Zhang, Jiazhao, et al.
Publicado: (2025)
por: Zhang, Jiazhao, et al.
Publicado: (2025)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
por: Zhong, Fangwei, et al.
Publicado: (2024)
por: Zhong, Fangwei, et al.
Publicado: (2024)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
por: Fan, Xianzhe, et al.
Publicado: (2026)
por: Fan, Xianzhe, et al.
Publicado: (2026)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
por: Wu, Kui, et al.
Publicado: (2025)
por: Wu, Kui, et al.
Publicado: (2025)
EF-Calib: Spatiotemporal Calibration of Event- and Frame-Based Cameras Using Continuous-Time Trajectories
por: Wang, Shaoan, et al.
Publicado: (2024)
por: Wang, Shaoan, et al.
Publicado: (2024)
Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation
por: Wang, Fangyuan, et al.
Publicado: (2026)
por: Wang, Fangyuan, et al.
Publicado: (2026)
CylinderTag: An Accurate and Flexible Marker for Cylinder-Shape Objects Pose Estimation Based on Projective Invariants
por: Wang, Shaoan, et al.
Publicado: (2023)
por: Wang, Shaoan, et al.
Publicado: (2023)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
OctoNav: Towards Generalist Embodied Navigation
por: Gao, Chen, et al.
Publicado: (2025)
por: Gao, Chen, et al.
Publicado: (2025)
Griffin: Aerial-Ground Cooperative Detection and Tracking Dataset and Benchmark
por: Wang, Jiahao, et al.
Publicado: (2025)
por: Wang, Jiahao, et al.
Publicado: (2025)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
por: Wu, Wayne, et al.
Publicado: (2024)
por: Wu, Wayne, et al.
Publicado: (2024)
RescueBench: Can Embodied Agents Save Lives in the Wild ?
por: Wu, Kui, et al.
Publicado: (2026)
por: Wu, Kui, et al.
Publicado: (2026)
Good Deep Features to Track: Self-Supervised Feature Extraction and Tracking in Visual Odometry
por: Gottam, Sai Puneeth Reddy, et al.
Publicado: (2025)
por: Gottam, Sai Puneeth Reddy, et al.
Publicado: (2025)
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
por: Liu, Jiahang, et al.
Publicado: (2026)
por: Liu, Jiahang, et al.
Publicado: (2026)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
por: Chu, Zedong, et al.
Publicado: (2026)
por: Chu, Zedong, et al.
Publicado: (2026)
TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers
por: Yu, Bin, et al.
Publicado: (2026)
por: Yu, Bin, et al.
Publicado: (2026)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
por: Peng, Baorui, et al.
Publicado: (2026)
por: Peng, Baorui, et al.
Publicado: (2026)
GarmentTracking: Category-Level Garment Pose Tracking
por: Xue, Han, et al.
Publicado: (2023)
por: Xue, Han, et al.
Publicado: (2023)
TAPTR: Tracking Any Point with Transformers as Detection
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
por: Miao, Shangchen, et al.
Publicado: (2026)
por: Miao, Shangchen, et al.
Publicado: (2026)
RockTrack: A 3D Robust Multi-Camera-Ken Multi-Object Tracking Framework
por: Li, Xiaoyu, et al.
Publicado: (2024)
por: Li, Xiaoyu, et al.
Publicado: (2024)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
por: Fang, Zhen, et al.
Publicado: (2025)
por: Fang, Zhen, et al.
Publicado: (2025)
HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
por: Yang, Tianshuo, et al.
Publicado: (2026)
por: Yang, Tianshuo, et al.
Publicado: (2026)
DK-SLAM: Monocular Visual SLAM with Deep Keypoint Learning, Tracking and Loop-Closing
por: Qu, Hao, et al.
Publicado: (2024)
por: Qu, Hao, et al.
Publicado: (2024)
SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
por: Zhang, Junjie, et al.
Publicado: (2024)
por: Zhang, Junjie, et al.
Publicado: (2024)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
por: He, Jiawei, et al.
Publicado: (2025)
por: He, Jiawei, et al.
Publicado: (2025)
AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking
por: Wu, Kui, et al.
Publicado: (2026)
por: Wu, Kui, et al.
Publicado: (2026)
A Pragmatic VLA Foundation Model
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation
por: Zhou, Hanyu, et al.
Publicado: (2026)
por: Zhou, Hanyu, et al.
Publicado: (2026)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
por: Zou, Ding, et al.
Publicado: (2025)
por: Zou, Ding, et al.
Publicado: (2025)
Ejemplares similares
-
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
por: Liu, Jiahang, et al.
Publicado: (2025) -
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024) -
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025) -
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
por: Zhong, Fangwei, et al.
Publicado: (2024) -
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
por: Xu, Tianyu, et al.
Publicado: (2025)