RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Enshen, Chi, Cheng, Li, Yibo, An, Jingkun, Zhang, Jiayuan, Rong, Shanyu, Han, Yi, Ji, Yuheng, Liu, Mengzhen, Wang, Pengwei, Wang, Zhongyuan, Sheng, Lu, Zhang, Shanghang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
di: Zhou, Enshen, et al.
Pubblicazione: (2025)
di: Zhou, Enshen, et al.
Pubblicazione: (2025)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
di: Han, Yi, et al.
Pubblicazione: (2025)
di: Han, Yi, et al.
Pubblicazione: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
RoboBrain 2.5: Depth in Sight, Time in Mind
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection
di: Zhou, Enshen, et al.
Pubblicazione: (2024)
di: Zhou, Enshen, et al.
Pubblicazione: (2024)
PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing
di: Ji, Yuheng, et al.
Pubblicazione: (2026)
di: Ji, Yuheng, et al.
Pubblicazione: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
di: Fu, Yankai, et al.
Pubblicazione: (2025)
di: Fu, Yankai, et al.
Pubblicazione: (2025)
From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
RoboBrain 2.0 Technical Report
di: BAAI RoboBrain Team, et al.
Pubblicazione: (2025)
di: BAAI RoboBrain Team, et al.
Pubblicazione: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
di: Wang, Sheng
Pubblicazione: (2025)
di: Wang, Sheng
Pubblicazione: (2025)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
di: Peng, Cheng, et al.
Pubblicazione: (2025)
di: Peng, Cheng, et al.
Pubblicazione: (2025)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
di: Huang, Yuzhi, et al.
Pubblicazione: (2026)
di: Huang, Yuzhi, et al.
Pubblicazione: (2026)
Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
di: Fu, Yankai, et al.
Pubblicazione: (2025)
di: Fu, Yankai, et al.
Pubblicazione: (2025)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
RoboArmGS: High-Quality Robotic Arm Splatting via Bézier Curve Refinement
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
di: Yuan, Wentao, et al.
Pubblicazione: (2024)
di: Yuan, Wentao, et al.
Pubblicazione: (2024)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
di: Liu, Jinkun, et al.
Pubblicazione: (2026)
di: Liu, Jinkun, et al.
Pubblicazione: (2026)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
RoboGolf: Mastering Real-World Minigolf with a Reflective Multi-Modality Vision-Language Model
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
RoboBERT: An End-to-end Multimodal Robotic Manipulation Model
di: Wang, Sicheng, et al.
Pubblicazione: (2025)
di: Wang, Sicheng, et al.
Pubblicazione: (2025)
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
di: Song, Chan Hee, et al.
Pubblicazione: (2024)
di: Song, Chan Hee, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
di: Zhou, Enshen, et al.
Pubblicazione: (2025) -
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
di: Han, Yi, et al.
Pubblicazione: (2025) -
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026) -
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2026) -
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)