Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Wulff, Theodor, Tavella, Federico, Maharjan, Rahul Singh, Adikari, Manith, Cangelosi, Angelo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint Action Language Modelling for Transparent Policy Execution
di: Wulff, Theodor, et al.
Pubblicazione: (2025)
di: Wulff, Theodor, et al.
Pubblicazione: (2025)
Noise-Free Explanation for Driving Action Prediction
di: Zhu, Hongbo, et al.
Pubblicazione: (2024)
di: Zhu, Hongbo, et al.
Pubblicazione: (2024)
Signs of Language: Embodied Sign Language Fingerspelling Acquisition from Demonstrations for Human-Robot Interaction
di: Tavella, Federico, et al.
Pubblicazione: (2022)
di: Tavella, Federico, et al.
Pubblicazione: (2022)
Bridging the Communication Gap: Artificial Agents Learning Sign Language through Imitation
di: Tavella, Federico, et al.
Pubblicazione: (2024)
di: Tavella, Federico, et al.
Pubblicazione: (2024)
Fake or Real, Can Robots Tell? Evaluating VLM Robustness to Domain Shift in Single-View Robotic Scene Understanding
di: Tavella, Federico, et al.
Pubblicazione: (2025)
di: Tavella, Federico, et al.
Pubblicazione: (2025)
From Concrete to Abstract: A Multimodal Generative Approach to Abstract Concept Learning
di: Xie, Haodong, et al.
Pubblicazione: (2024)
di: Xie, Haodong, et al.
Pubblicazione: (2024)
Hierarchical, Interpretable, Label-Free Concept Bottleneck Model
di: Xie, Haodong, et al.
Pubblicazione: (2026)
di: Xie, Haodong, et al.
Pubblicazione: (2026)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
di: Hu, Yanbin, et al.
Pubblicazione: (2026)
di: Hu, Yanbin, et al.
Pubblicazione: (2026)
Phonology Recognition in American Sign Language
di: Tavella, Federico, et al.
Pubblicazione: (2021)
di: Tavella, Federico, et al.
Pubblicazione: (2021)
Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
di: Chen, William, et al.
Pubblicazione: (2026)
di: Chen, William, et al.
Pubblicazione: (2026)
Action Hallucination in Generative Vision-Language-Action Models
di: Soh, Harold, et al.
Pubblicazione: (2026)
di: Soh, Harold, et al.
Pubblicazione: (2026)
Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment
di: Wang, Libo
Pubblicazione: (2025)
di: Wang, Libo
Pubblicazione: (2025)
Hierarchical Vision Language Action Model Using Success and Failure Demonstrations
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
di: Darabi, Nastaran, et al.
Pubblicazione: (2026)
di: Darabi, Nastaran, et al.
Pubblicazione: (2026)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
di: Liang, Yuanchang, et al.
Pubblicazione: (2026)
di: Liang, Yuanchang, et al.
Pubblicazione: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
di: Zhong, Yifan, et al.
Pubblicazione: (2025)
di: Zhong, Yifan, et al.
Pubblicazione: (2025)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
di: Vo, Khoa, et al.
Pubblicazione: (2025)
di: Vo, Khoa, et al.
Pubblicazione: (2025)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
di: Jin, Xinchen, et al.
Pubblicazione: (2026)
di: Jin, Xinchen, et al.
Pubblicazione: (2026)
FAST: Efficient Action Tokenization for Vision-Language-Action Models
di: Pertsch, Karl, et al.
Pubblicazione: (2025)
di: Pertsch, Karl, et al.
Pubblicazione: (2025)
LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models
di: Li, Zuolei, et al.
Pubblicazione: (2025)
di: Li, Zuolei, et al.
Pubblicazione: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
di: Zhang, Zhengshen, et al.
Pubblicazione: (2025)
di: Zhang, Zhengshen, et al.
Pubblicazione: (2025)
Stable Language Guidance for Vision-Language-Action Models
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
Observing and Controlling Features in Vision-Language-Action Models
di: Buurmeijer, Hugo, et al.
Pubblicazione: (2026)
di: Buurmeijer, Hugo, et al.
Pubblicazione: (2026)
Embodiment Transfer Learning for Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
Jump-Start Reinforcement Learning with Vision-Language-Action Regularization
di: Moroncelli, Angelo, et al.
Pubblicazione: (2026)
di: Moroncelli, Angelo, et al.
Pubblicazione: (2026)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
di: Lin, Tao, et al.
Pubblicazione: (2025)
di: Lin, Tao, et al.
Pubblicazione: (2025)
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
di: Niu, Haochen, et al.
Pubblicazione: (2026)
di: Niu, Haochen, et al.
Pubblicazione: (2026)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
Confidence Calibration in Vision-Language-Action Models
di: Zollo, Thomas P, et al.
Pubblicazione: (2025)
di: Zollo, Thomas P, et al.
Pubblicazione: (2025)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
di: Kong, Weijie, et al.
Pubblicazione: (2026)
di: Kong, Weijie, et al.
Pubblicazione: (2026)
TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation
di: Huang, Yuzhe, et al.
Pubblicazione: (2026)
di: Huang, Yuzhe, et al.
Pubblicazione: (2026)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
di: Li, Runze, et al.
Pubblicazione: (2026)
di: Li, Runze, et al.
Pubblicazione: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
di: Hu, Yutong, et al.
Pubblicazione: (2026)
di: Hu, Yutong, et al.
Pubblicazione: (2026)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
di: Dai, Yuntao, et al.
Pubblicazione: (2025)
di: Dai, Yuntao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Joint Action Language Modelling for Transparent Policy Execution
di: Wulff, Theodor, et al.
Pubblicazione: (2025) -
Noise-Free Explanation for Driving Action Prediction
di: Zhu, Hongbo, et al.
Pubblicazione: (2024) -
Signs of Language: Embodied Sign Language Fingerspelling Acquisition from Demonstrations for Human-Robot Interaction
di: Tavella, Federico, et al.
Pubblicazione: (2022) -
Bridging the Communication Gap: Artificial Agents Learning Sign Language through Imitation
di: Tavella, Federico, et al.
Pubblicazione: (2024) -
Fake or Real, Can Robots Tell? Evaluating VLM Robustness to Domain Shift in Single-View Robotic Scene Understanding
di: Tavella, Federico, et al.
Pubblicazione: (2025)