GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Wenxuan, Li, Ziyuan, Zhang, Meng, Liu, Yichen, Dong, Yimeng, Xu, Chuxi, Wei, Yunfei, Chen, Ze, Zhou, Erjin, Feng, Jianjiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
par: Zhu, Xiang, et autres
Publié: (2026)
par: Zhu, Xiang, et autres
Publié: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
par: Guo, Peizheng, et autres
Publié: (2026)
par: Guo, Peizheng, et autres
Publié: (2026)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
par: Lin, Minghui, et autres
Publié: (2025)
par: Lin, Minghui, et autres
Publié: (2025)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
par: Li, Meng, et autres
Publié: (2025)
par: Li, Meng, et autres
Publié: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
par: Abouzeid, Ali, et autres
Publié: (2025)
par: Abouzeid, Ali, et autres
Publié: (2025)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
par: Zhao, Han, et autres
Publié: (2025)
par: Zhao, Han, et autres
Publié: (2025)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
par: Kong, Weijie, et autres
Publié: (2026)
par: Kong, Weijie, et autres
Publié: (2026)
ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
par: Li, Hang, et autres
Publié: (2026)
par: Li, Hang, et autres
Publié: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
STARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action Models
par: Xu, Feng, et autres
Publié: (2025)
par: Xu, Feng, et autres
Publié: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation
par: Huang, Yuzhe, et autres
Publié: (2026)
par: Huang, Yuzhe, et autres
Publié: (2026)
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
par: Li, Jinming, et autres
Publié: (2024)
par: Li, Jinming, et autres
Publié: (2024)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
par: Wang, Yihao, et autres
Publié: (2025)
par: Wang, Yihao, et autres
Publié: (2025)
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
par: Gao, Yuan, et autres
Publié: (2026)
par: Gao, Yuan, et autres
Publié: (2026)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
par: Guo, Xinyu, et autres
Publié: (2026)
par: Guo, Xinyu, et autres
Publié: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
par: Zhong, Zhide, et autres
Publié: (2025)
par: Zhong, Zhide, et autres
Publié: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026)
par: Zhong, Linqing, et autres
Publié: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
par: Yang, Ran, et autres
Publié: (2025)
par: Yang, Ran, et autres
Publié: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
par: Deng, Shengliang, et autres
Publié: (2025)
par: Deng, Shengliang, et autres
Publié: (2025)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
par: Li, Ye, et autres
Publié: (2026)
par: Li, Ye, et autres
Publié: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition
par: Han, Gaoge, et autres
Publié: (2026)
par: Han, Gaoge, et autres
Publié: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
par: Pan, Xu, et autres
Publié: (2026)
par: Pan, Xu, et autres
Publié: (2026)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
par: Sun, Jianli, et autres
Publié: (2026)
par: Sun, Jianli, et autres
Publié: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
par: Hu, Yucheng, et autres
Publié: (2026)
par: Hu, Yucheng, et autres
Publié: (2026)
Documents similaires
-
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
par: Zhu, Xiang, et autres
Publié: (2026) -
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026) -
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025) -
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
par: Guo, Peizheng, et autres
Publié: (2026) -
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
par: Lin, Minghui, et autres
Publié: (2025)