Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ling, Yiran, Lian, Qing, Li, Jinghang, Jiang, Qing, Zhang, Tianming, Jiang, Xiaoke, Liu, Chuanxiu, Liu, Jie, Zhang, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpatialPoint: Spatial-aware Point Prediction for Embodied Localization
di: Zhu, Qiming, et al.
Pubblicazione: (2026)
di: Zhu, Qiming, et al.
Pubblicazione: (2026)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
di: Xu, Kechun, et al.
Pubblicazione: (2025)
di: Xu, Kechun, et al.
Pubblicazione: (2025)
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
di: Wang, Guokang, et al.
Pubblicazione: (2024)
di: Wang, Guokang, et al.
Pubblicazione: (2024)
ProAct: A Dual-System Framework for Proactive Embodied Social Agents
di: Zhang, Zeyi, et al.
Pubblicazione: (2026)
di: Zhang, Zeyi, et al.
Pubblicazione: (2026)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
di: Lei, Zixing, et al.
Pubblicazione: (2026)
di: Lei, Zixing, et al.
Pubblicazione: (2026)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation
di: Wang, Fangyuan, et al.
Pubblicazione: (2026)
di: Wang, Fangyuan, et al.
Pubblicazione: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
di: Fang, Zhen, et al.
Pubblicazione: (2025)
di: Fang, Zhen, et al.
Pubblicazione: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
di: Ye, Angen, et al.
Pubblicazione: (2025)
di: Ye, Angen, et al.
Pubblicazione: (2025)
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
di: Zhou, Heng, et al.
Pubblicazione: (2026)
di: Zhou, Heng, et al.
Pubblicazione: (2026)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
3DRot: Rediscovering the Missing Primitive for RGB-Based 3D Augmentation
di: Yang, Shitian, et al.
Pubblicazione: (2025)
di: Yang, Shitian, et al.
Pubblicazione: (2025)
Nav-R1: Reasoning and Navigation in Embodied Scenes
di: Liu, Qingxiang, et al.
Pubblicazione: (2025)
di: Liu, Qingxiang, et al.
Pubblicazione: (2025)
Octopus: Embodied Vision-Language Programmer from Environmental Feedback
di: Yang, Jingkang, et al.
Pubblicazione: (2023)
di: Yang, Jingkang, et al.
Pubblicazione: (2023)
EnerVerse-AC: Envisioning Embodied Environments with Action Condition
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
TesserAct: Learning 4D Embodied World Models
di: Zhen, Haoyu, et al.
Pubblicazione: (2025)
di: Zhen, Haoyu, et al.
Pubblicazione: (2025)
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
di: Liu, Dayong, et al.
Pubblicazione: (2025)
di: Liu, Dayong, et al.
Pubblicazione: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
di: Ma, Guoqing, et al.
Pubblicazione: (2026)
di: Ma, Guoqing, et al.
Pubblicazione: (2026)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
di: Wang, Guodong, et al.
Pubblicazione: (2026)
di: Wang, Guodong, et al.
Pubblicazione: (2026)
Universal Actions for Enhanced Embodied Foundation Models
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
di: Wen, Junjie, et al.
Pubblicazione: (2025)
di: Wen, Junjie, et al.
Pubblicazione: (2025)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
Closed Loop Interactive Embodied Reasoning for Robot Manipulation
di: Nazarczuk, Michal, et al.
Pubblicazione: (2024)
di: Nazarczuk, Michal, et al.
Pubblicazione: (2024)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
di: Zhao, Chen, et al.
Pubblicazione: (2026)
di: Zhao, Chen, et al.
Pubblicazione: (2026)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
di: Chen, Shizhe, et al.
Pubblicazione: (2026)
di: Chen, Shizhe, et al.
Pubblicazione: (2026)
What Matters in Building Vision-Language-Action Models for Generalist Robots
di: Li, Xinghang, et al.
Pubblicazione: (2024)
di: Li, Xinghang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SpatialPoint: Spatial-aware Point Prediction for Embodied Localization
di: Zhu, Qiming, et al.
Pubblicazione: (2026) -
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
di: Ye, Wencheng, et al.
Pubblicazione: (2025) -
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026) -
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025) -
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
di: Xu, Kechun, et al.
Pubblicazione: (2025)