Stable Language Guidance for Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhan, Zhihao, Chen, Yuhao, Zhou, Jiaying, Lyu, Qinhan, Liu, Hao, Wang, Keze, Lin, Liang, Wang, Guangrun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
par: Zhou, Jiaying, et autres
Publié: (2026)
par: Zhou, Jiaying, et autres
Publié: (2026)
RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion
par: Zhan, Zhihao, et autres
Publié: (2025)
par: Zhan, Zhihao, et autres
Publié: (2025)
Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)
par: Budzianowski, Paweł, et autres
Publié: (2025)
Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
par: Wang, Qiuyue, et autres
Publié: (2026)
par: Wang, Qiuyue, et autres
Publié: (2026)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
par: Li, Qixiu, et autres
Publié: (2024)
par: Li, Qixiu, et autres
Publié: (2024)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
par: Hou, Yuchen, et autres
Publié: (2026)
par: Hou, Yuchen, et autres
Publié: (2026)
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
par: Srikanth, Siddharth, et autres
Publié: (2026)
par: Srikanth, Siddharth, et autres
Publié: (2026)
Joint Action Language Modelling for Transparent Policy Execution
par: Wulff, Theodor, et autres
Publié: (2025)
par: Wulff, Theodor, et autres
Publié: (2025)
Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models
par: Song, Zijian, et autres
Publié: (2026)
par: Song, Zijian, et autres
Publié: (2026)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion
par: Xu, Yuanfeng, et autres
Publié: (2026)
par: Xu, Yuanfeng, et autres
Publié: (2026)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
par: Yu, Zhuoyuan, et autres
Publié: (2025)
par: Yu, Zhuoyuan, et autres
Publié: (2025)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)
par: An, Dong, et autres
Publié: (2023)
OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models
par: Kuang, Yuxuan, et autres
Publié: (2024)
par: Kuang, Yuxuan, et autres
Publié: (2024)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
par: Darabi, Nastaran, et autres
Publié: (2026)
par: Darabi, Nastaran, et autres
Publié: (2026)
Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback
par: Zhu, Wang, et autres
Publié: (2024)
par: Zhu, Wang, et autres
Publié: (2024)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
3D-VLA: A 3D Vision-Language-Action Generative World Model
par: Zhen, Haoyu, et autres
Publié: (2024)
par: Zhen, Haoyu, et autres
Publié: (2024)
PRISM: Preference Refinement via Implicit Scene Modeling for 3D Vision-Language Preference-Based Reinforcement Learning
par: Sun, Yirong, et autres
Publié: (2025)
par: Sun, Yirong, et autres
Publié: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026)
par: Liufu, Weijia, et autres
Publié: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
par: Hong, Haodong, et autres
Publié: (2024)
par: Hong, Haodong, et autres
Publié: (2024)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
X-Driver: Explainable Autonomous Driving with Vision-Language Models
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
par: Xu, Yuhao, et autres
Publié: (2026)
par: Xu, Yuhao, et autres
Publié: (2026)
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
par: Fu, Yiyang, et autres
Publié: (2026)
par: Fu, Yiyang, et autres
Publié: (2026)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
par: Lu, Jinghui, et autres
Publié: (2026)
par: Lu, Jinghui, et autres
Publié: (2026)
What Limits Vision-and-Language Navigation ?
par: Wang, Yunheng, et autres
Publié: (2026)
par: Wang, Yunheng, et autres
Publié: (2026)
MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models
par: Zhou, Xunlan, et autres
Publié: (2026)
par: Zhou, Xunlan, et autres
Publié: (2026)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
par: Song, Wenxuan, et autres
Publié: (2026)
par: Song, Wenxuan, et autres
Publié: (2026)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
par: Zheng, Jinliang, et autres
Publié: (2025)
par: Zheng, Jinliang, et autres
Publié: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
par: Wang, Liuyi, et autres
Publié: (2025)
par: Wang, Liuyi, et autres
Publié: (2025)
Documents similaires
-
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
par: Zhou, Jiaying, et autres
Publié: (2026) -
RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation
par: Chen, Yuhao, et autres
Publié: (2026) -
E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion
par: Zhan, Zhihao, et autres
Publié: (2025) -
Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
par: Li, Pengxiang, et autres
Publié: (2025) -
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)