FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yichi, Yuan, Weihao, Zhang, Yizhuo, Zhang, Xidong, Wan, Jia |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
von: Zhang, Yuhao, et al.
Veröffentlicht: (2026)
von: Zhang, Yuhao, et al.
Veröffentlicht: (2026)
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
von: Su, Taiyi, et al.
Veröffentlicht: (2026)
von: Su, Taiyi, et al.
Veröffentlicht: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2025)
von: Zhong, Zhide, et al.
Veröffentlicht: (2025)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
von: Zhang, Dapeng, et al.
Veröffentlicht: (2025)
von: Zhang, Dapeng, et al.
Veröffentlicht: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
von: Jin, Ruofan, et al.
Veröffentlicht: (2026)
von: Jin, Ruofan, et al.
Veröffentlicht: (2026)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
von: Xue, Wei, et al.
Veröffentlicht: (2026)
von: Xue, Wei, et al.
Veröffentlicht: (2026)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
von: Ye, Angen, et al.
Veröffentlicht: (2025)
von: Ye, Angen, et al.
Veröffentlicht: (2025)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2026)
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2026)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
von: Sun, Jianli, et al.
Veröffentlicht: (2026)
von: Sun, Jianli, et al.
Veröffentlicht: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
von: Zhong, Linqing, et al.
Veröffentlicht: (2026)
von: Zhong, Linqing, et al.
Veröffentlicht: (2026)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
von: Zhang, Hongyin, et al.
Veröffentlicht: (2025)
von: Zhang, Hongyin, et al.
Veröffentlicht: (2025)
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
von: Qu, Delin, et al.
Veröffentlicht: (2025)
von: Qu, Delin, et al.
Veröffentlicht: (2025)
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
von: Fu, Yuxia, et al.
Veröffentlicht: (2025)
von: Fu, Yuxia, et al.
Veröffentlicht: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
von: Zeng, Qixin, et al.
Veröffentlicht: (2026)
von: Zeng, Qixin, et al.
Veröffentlicht: (2026)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
von: Zhang, Rongyu, et al.
Veröffentlicht: (2025)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
von: Cen, Jun, et al.
Veröffentlicht: (2025)
von: Cen, Jun, et al.
Veröffentlicht: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
von: Bai, Shuanghao, et al.
Veröffentlicht: (2026)
von: Bai, Shuanghao, et al.
Veröffentlicht: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
von: Ye, Jinhui, et al.
Veröffentlicht: (2026)
von: Ye, Jinhui, et al.
Veröffentlicht: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
von: Li, Boyu, et al.
Veröffentlicht: (2026)
von: Li, Boyu, et al.
Veröffentlicht: (2026)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
von: Zhang, Kaidi, et al.
Veröffentlicht: (2026)
von: Zhang, Kaidi, et al.
Veröffentlicht: (2026)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
von: Zhao, Han, et al.
Veröffentlicht: (2025)
von: Zhao, Han, et al.
Veröffentlicht: (2025)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
von: Zhang, Zongzheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zongzheng, et al.
Veröffentlicht: (2025)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
von: Peng, Xiongfeng, et al.
Veröffentlicht: (2026)
von: Peng, Xiongfeng, et al.
Veröffentlicht: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
von: Wang, Yihao, et al.
Veröffentlicht: (2025)
von: Wang, Yihao, et al.
Veröffentlicht: (2025)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
von: Li, Ye, et al.
Veröffentlicht: (2026)
von: Li, Ye, et al.
Veröffentlicht: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
von: Li, Anqi, et al.
Veröffentlicht: (2025)
von: Li, Anqi, et al.
Veröffentlicht: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
von: Budzianowski, Paweł, et al.
Veröffentlicht: (2025)
von: Budzianowski, Paweł, et al.
Veröffentlicht: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
von: Gao, Yuan, et al.
Veröffentlicht: (2026)
von: Gao, Yuan, et al.
Veröffentlicht: (2026)
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
von: Li, Jinming, et al.
Veröffentlicht: (2024)
von: Li, Jinming, et al.
Veröffentlicht: (2024)
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
von: Xiao, Lei, et al.
Veröffentlicht: (2025)
von: Xiao, Lei, et al.
Veröffentlicht: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models
von: Huang, Alex S., et al.
Veröffentlicht: (2026)
von: Huang, Alex S., et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
von: Wang, Zixuan, et al.
Veröffentlicht: (2026) -
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
von: Deng, Shengliang, et al.
Veröffentlicht: (2025) -
RedVLA: Physical Red Teaming for Vision-Language-Action Models
von: Zhang, Yuhao, et al.
Veröffentlicht: (2026) -
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
von: Su, Taiyi, et al.
Veröffentlicht: (2026) -
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2025)