Salvato in:
| Autori principali: | Lin, Zijun, Duan, Jiafei, Fang, Haoquan, Fox, Dieter, Krishna, Ranjay, Tan, Cheston, Wen, Bihan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.01642 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning
di: Tur, Yalcin, et al.
Pubblicazione: (2026)
di: Tur, Yalcin, et al.
Pubblicazione: (2026)
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
di: Fang, Haoquan, et al.
Pubblicazione: (2025)
di: Fang, Haoquan, et al.
Pubblicazione: (2025)
AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
EVE: Enabling Anyone to Train Robots using Augmented Reality
di: Wang, Jun, et al.
Pubblicazione: (2024)
di: Wang, Jun, et al.
Pubblicazione: (2024)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
di: Yuan, Wentao, et al.
Pubblicazione: (2024)
di: Yuan, Wentao, et al.
Pubblicazione: (2024)
MolmoAct: Action Reasoning Models that can Reason in Space
di: Lee, Jason, et al.
Pubblicazione: (2025)
di: Lee, Jason, et al.
Pubblicazione: (2025)
THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation
di: Pumacay, Wilbert, et al.
Pubblicazione: (2024)
di: Pumacay, Wilbert, et al.
Pubblicazione: (2024)
VLS: Steering Pretrained Robot Policies via Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2026)
di: Liu, Shuo, et al.
Pubblicazione: (2026)
GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding
di: Lin, Zijun, et al.
Pubblicazione: (2025)
di: Lin, Zijun, et al.
Pubblicazione: (2025)
MolmoAct2: Action Reasoning Models for Real-world Deployment
di: Fang, Haoquan, et al.
Pubblicazione: (2026)
di: Fang, Haoquan, et al.
Pubblicazione: (2026)
Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models
di: Zheng, Meng, et al.
Pubblicazione: (2026)
di: Zheng, Meng, et al.
Pubblicazione: (2026)
Octopi: Object Property Reasoning with Large Tactile-Language Models
di: Yu, Samson, et al.
Pubblicazione: (2024)
di: Yu, Samson, et al.
Pubblicazione: (2024)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
di: Chen, Shirui, et al.
Pubblicazione: (2026)
di: Chen, Shirui, et al.
Pubblicazione: (2026)
FailSafe: High-performance Resilient Serving
di: Xu, Ziyi, et al.
Pubblicazione: (2025)
di: Xu, Ziyi, et al.
Pubblicazione: (2025)
10 Open Challenges Steering the Future of Vision-Language-Action Models
di: Poria, Soujanya, et al.
Pubblicazione: (2025)
di: Poria, Soujanya, et al.
Pubblicazione: (2025)
I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models
di: Grislain, Clemence, et al.
Pubblicazione: (2025)
di: Grislain, Clemence, et al.
Pubblicazione: (2025)
Expect the Unexpected: FailSafe Long Context QA for Finance
di: Kamble, Kiran, et al.
Pubblicazione: (2025)
di: Kamble, Kiran, et al.
Pubblicazione: (2025)
RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation
di: Wang, Yi Ru, et al.
Pubblicazione: (2025)
di: Wang, Yi Ru, et al.
Pubblicazione: (2025)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
di: Ray, Arijit, et al.
Pubblicazione: (2024)
di: Ray, Arijit, et al.
Pubblicazione: (2024)
Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts
di: Chen, Hongyi, et al.
Pubblicazione: (2024)
di: Chen, Hongyi, et al.
Pubblicazione: (2024)
GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation
di: Deshpande, Abhay, et al.
Pubblicazione: (2025)
di: Deshpande, Abhay, et al.
Pubblicazione: (2025)
RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields
di: Sagar, Som, et al.
Pubblicazione: (2024)
di: Sagar, Som, et al.
Pubblicazione: (2024)
SAFE: Multitask Failure Detection for Vision-Language-Action Models
di: Gu, Qiao, et al.
Pubblicazione: (2025)
di: Gu, Qiao, et al.
Pubblicazione: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
di: Deshpande, Abhay, et al.
Pubblicazione: (2026)
di: Deshpande, Abhay, et al.
Pubblicazione: (2026)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
di: Su, Xia, et al.
Pubblicazione: (2026)
di: Su, Xia, et al.
Pubblicazione: (2026)
OG-VLA: Orthographic Image Generation for 3D-Aware Vision-Language Action Model
di: Singh, Ishika, et al.
Pubblicazione: (2025)
di: Singh, Ishika, et al.
Pubblicazione: (2025)
FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
Hierarchical Vision Language Action Model Using Success and Failure Demonstrations
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
di: Lin, Fanqi, et al.
Pubblicazione: (2025)
di: Lin, Fanqi, et al.
Pubblicazione: (2025)
Guiding Long-Horizon Task and Motion Planning with Vision Language Models
di: Yang, Zhutian, et al.
Pubblicazione: (2024)
di: Yang, Zhutian, et al.
Pubblicazione: (2024)
A Human-in-the-Loop Confidence-Aware Failure Recovery Framework for Modular Robot Policies
di: Banerjee, Rohan, et al.
Pubblicazione: (2026)
di: Banerjee, Rohan, et al.
Pubblicazione: (2026)
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
di: Wen, Congcong, et al.
Pubblicazione: (2024)
di: Wen, Congcong, et al.
Pubblicazione: (2024)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning
di: Qi, Carl, et al.
Pubblicazione: (2026)
di: Qi, Carl, et al.
Pubblicazione: (2026)
InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning
di: Zhang, Ji, et al.
Pubblicazione: (2025)
di: Zhang, Ji, et al.
Pubblicazione: (2025)
Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models
di: Liu, Haoyun, et al.
Pubblicazione: (2026)
di: Liu, Haoyun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning
di: Tur, Yalcin, et al.
Pubblicazione: (2026) -
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
di: Fang, Haoquan, et al.
Pubblicazione: (2025) -
AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
di: Duan, Jiafei, et al.
Pubblicazione: (2024) -
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
di: Duan, Jiafei, et al.
Pubblicazione: (2024) -
EVE: Enabling Anyone to Train Robots using Augmented Reality
di: Wang, Jun, et al.
Pubblicazione: (2024)