Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Grant, Bryce, Zhao, Xijia, Wang, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
por: Xu, Yuhao, et al.
Publicado: (2026)
por: Xu, Yuhao, et al.
Publicado: (2026)
Observing and Controlling Features in Vision-Language-Action Models
por: Buurmeijer, Hugo, et al.
Publicado: (2026)
por: Buurmeijer, Hugo, et al.
Publicado: (2026)
Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection
por: Grant, Bryce, et al.
Publicado: (2025)
por: Grant, Bryce, et al.
Publicado: (2025)
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
por: Liang, Yuanchang, et al.
Publicado: (2026)
por: Liang, Yuanchang, et al.
Publicado: (2026)
Embodiment Transfer Learning for Vision-Language-Action Models
por: Li, Chengmeng, et al.
Publicado: (2025)
por: Li, Chengmeng, et al.
Publicado: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
Are All Marine Species Created Equal? Performance Disparities in Underwater Object Detection
por: Wille, Melanie, et al.
Publicado: (2025)
por: Wille, Melanie, et al.
Publicado: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
por: Deng, Shengliang, et al.
Publicado: (2025)
por: Deng, Shengliang, et al.
Publicado: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025)
por: Mitra, Chancharik, et al.
Publicado: (2025)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
por: Zhu, Ziyue, et al.
Publicado: (2026)
por: Zhu, Ziyue, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
por: Zhong, Yifan, et al.
Publicado: (2025)
por: Zhong, Yifan, et al.
Publicado: (2025)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter
por: Xu, Kechun, et al.
Publicado: (2023)
por: Xu, Kechun, et al.
Publicado: (2023)
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
por: Zhang, Chaofan, et al.
Publicado: (2025)
por: Zhang, Chaofan, et al.
Publicado: (2025)
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
por: Liu, Yudong, et al.
Publicado: (2026)
por: Liu, Yudong, et al.
Publicado: (2026)
LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models
por: Li, Zuolei, et al.
Publicado: (2025)
por: Li, Zuolei, et al.
Publicado: (2025)
HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models
por: Chen, Zixing, et al.
Publicado: (2026)
por: Chen, Zixing, et al.
Publicado: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
por: Peng, Xiongfeng, et al.
Publicado: (2026)
por: Peng, Xiongfeng, et al.
Publicado: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
por: Wang, Yihao, et al.
Publicado: (2025)
por: Wang, Yihao, et al.
Publicado: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Stable Language Guidance for Vision-Language-Action Models
por: Zhan, Zhihao, et al.
Publicado: (2026)
por: Zhan, Zhihao, et al.
Publicado: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
por: Lin, Yihan, et al.
Publicado: (2026)
por: Lin, Yihan, et al.
Publicado: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
por: Kong, Weijie, et al.
Publicado: (2026)
por: Kong, Weijie, et al.
Publicado: (2026)
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
por: Hu, Yanbin, et al.
Publicado: (2026)
por: Hu, Yanbin, et al.
Publicado: (2026)
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
por: Zhao, Ruihan, et al.
Publicado: (2025)
por: Zhao, Ruihan, et al.
Publicado: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
por: Li, Boyu, et al.
Publicado: (2026)
por: Li, Boyu, et al.
Publicado: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
por: Wulff, Theodor, et al.
Publicado: (2026)
por: Wulff, Theodor, et al.
Publicado: (2026)
VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions
por: Chen, Guanyan, et al.
Publicado: (2024)
por: Chen, Guanyan, et al.
Publicado: (2024)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
por: Chen, Xiaoyu, et al.
Publicado: (2025)
por: Chen, Xiaoyu, et al.
Publicado: (2025)
STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations
por: Xie, Yuhan, et al.
Publicado: (2026)
por: Xie, Yuhan, et al.
Publicado: (2026)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
Action Hallucination in Generative Vision-Language-Action Models
por: Soh, Harold, et al.
Publicado: (2026)
por: Soh, Harold, et al.
Publicado: (2026)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
por: Li, Meng, et al.
Publicado: (2025)
por: Li, Meng, et al.
Publicado: (2025)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
por: Lin, Fanqi, et al.
Publicado: (2025)
por: Lin, Fanqi, et al.
Publicado: (2025)
Ejemplares similares
-
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
por: Xu, Yuhao, et al.
Publicado: (2026) -
Observing and Controlling Features in Vision-Language-Action Models
por: Buurmeijer, Hugo, et al.
Publicado: (2026) -
Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection
por: Grant, Bryce, et al.
Publicado: (2025) -
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
por: Liang, Yuanchang, et al.
Publicado: (2026) -
Embodiment Transfer Learning for Vision-Language-Action Models
por: Li, Chengmeng, et al.
Publicado: (2025)