Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grant, Bryce, Zhao, Xijia, Wang, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
par: Xu, Yuhao, et autres
Publié: (2026)
par: Xu, Yuhao, et autres
Publié: (2026)
Observing and Controlling Features in Vision-Language-Action Models
par: Buurmeijer, Hugo, et autres
Publié: (2026)
par: Buurmeijer, Hugo, et autres
Publié: (2026)
Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection
par: Grant, Bryce, et autres
Publié: (2025)
par: Grant, Bryce, et autres
Publié: (2025)
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
par: Liang, Yuanchang, et autres
Publié: (2026)
par: Liang, Yuanchang, et autres
Publié: (2026)
Embodiment Transfer Learning for Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
Are All Marine Species Created Equal? Performance Disparities in Underwater Object Detection
par: Wille, Melanie, et autres
Publié: (2025)
par: Wille, Melanie, et autres
Publié: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
par: Deng, Shengliang, et autres
Publié: (2025)
par: Deng, Shengliang, et autres
Publié: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
par: Zhu, Ziyue, et autres
Publié: (2026)
par: Zhu, Ziyue, et autres
Publié: (2026)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
par: Zhong, Yifan, et autres
Publié: (2025)
par: Zhong, Yifan, et autres
Publié: (2025)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter
par: Xu, Kechun, et autres
Publié: (2023)
par: Xu, Kechun, et autres
Publié: (2023)
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
par: Zhang, Chaofan, et autres
Publié: (2025)
par: Zhang, Chaofan, et autres
Publié: (2025)
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
par: Liu, Yudong, et autres
Publié: (2026)
par: Liu, Yudong, et autres
Publié: (2026)
LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models
par: Li, Zuolei, et autres
Publié: (2025)
par: Li, Zuolei, et autres
Publié: (2025)
HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models
par: Chen, Zixing, et autres
Publié: (2026)
par: Chen, Zixing, et autres
Publié: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
par: Peng, Xiongfeng, et autres
Publié: (2026)
par: Peng, Xiongfeng, et autres
Publié: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
par: Wang, Yihao, et autres
Publié: (2025)
par: Wang, Yihao, et autres
Publié: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
Stable Language Guidance for Vision-Language-Action Models
par: Zhan, Zhihao, et autres
Publié: (2026)
par: Zhan, Zhihao, et autres
Publié: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
par: Lin, Yihan, et autres
Publié: (2026)
par: Lin, Yihan, et autres
Publié: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
par: Kong, Weijie, et autres
Publié: (2026)
par: Kong, Weijie, et autres
Publié: (2026)
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
par: Hu, Yanbin, et autres
Publié: (2026)
par: Hu, Yanbin, et autres
Publié: (2026)
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
par: Zhao, Ruihan, et autres
Publié: (2025)
par: Zhao, Ruihan, et autres
Publié: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
par: Li, Boyu, et autres
Publié: (2026)
par: Li, Boyu, et autres
Publié: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026)
par: Zhong, Linqing, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
par: Wulff, Theodor, et autres
Publié: (2026)
par: Wulff, Theodor, et autres
Publié: (2026)
VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions
par: Chen, Guanyan, et autres
Publié: (2024)
par: Chen, Guanyan, et autres
Publié: (2024)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations
par: Xie, Yuhan, et autres
Publié: (2026)
par: Xie, Yuhan, et autres
Publié: (2026)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
par: Zhao, Han, et autres
Publié: (2025)
par: Zhao, Han, et autres
Publié: (2025)
Action Hallucination in Generative Vision-Language-Action Models
par: Soh, Harold, et autres
Publié: (2026)
par: Soh, Harold, et autres
Publié: (2026)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
par: Li, Meng, et autres
Publié: (2025)
par: Li, Meng, et autres
Publié: (2025)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
par: Lin, Fanqi, et autres
Publié: (2025)
par: Lin, Fanqi, et autres
Publié: (2025)
Documents similaires
-
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
par: Xu, Yuhao, et autres
Publié: (2026) -
Observing and Controlling Features in Vision-Language-Action Models
par: Buurmeijer, Hugo, et autres
Publié: (2026) -
Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection
par: Grant, Bryce, et autres
Publié: (2025) -
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
par: Liang, Yuanchang, et autres
Publié: (2026) -
Embodiment Transfer Learning for Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)