Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Baoshun, He, Haoran, Pan, Ling, Liu, Yang, Lin, Liang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
di: Wang, Yating, et al.
Pubblicazione: (2025)
di: Wang, Yating, et al.
Pubblicazione: (2025)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
di: Liang, Wenqi, et al.
Pubblicazione: (2025)
di: Liang, Wenqi, et al.
Pubblicazione: (2025)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
di: Govind, Manish Kumar, et al.
Pubblicazione: (2026)
di: Govind, Manish Kumar, et al.
Pubblicazione: (2026)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
di: Xiao, Wenli, et al.
Pubblicazione: (2025)
di: Xiao, Wenli, et al.
Pubblicazione: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
di: Li, Yixuan, et al.
Pubblicazione: (2025)
di: Li, Yixuan, et al.
Pubblicazione: (2025)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
di: Yang, Yurou, et al.
Pubblicazione: (2026)
di: Yang, Yurou, et al.
Pubblicazione: (2026)
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
di: Fang, Irving, et al.
Pubblicazione: (2025)
di: Fang, Irving, et al.
Pubblicazione: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
di: Lin, Yihan, et al.
Pubblicazione: (2026)
di: Lin, Yihan, et al.
Pubblicazione: (2026)
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
di: Huang, Huang, et al.
Pubblicazione: (2025)
di: Huang, Huang, et al.
Pubblicazione: (2025)
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
di: Lin, Haitao, et al.
Pubblicazione: (2026)
di: Lin, Haitao, et al.
Pubblicazione: (2026)
See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation
di: Dai, Tingjun, et al.
Pubblicazione: (2026)
di: Dai, Tingjun, et al.
Pubblicazione: (2026)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
di: Yang, Jiabing, et al.
Pubblicazione: (2026)
di: Yang, Jiabing, et al.
Pubblicazione: (2026)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
di: Chen, Kehan, et al.
Pubblicazione: (2024)
di: Chen, Kehan, et al.
Pubblicazione: (2024)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
di: Zhao, Chen, et al.
Pubblicazione: (2026)
di: Zhao, Chen, et al.
Pubblicazione: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance
di: Li, Zhuohao, et al.
Pubblicazione: (2026)
di: Li, Zhuohao, et al.
Pubblicazione: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026)
di: Li, Qiwei, et al.
Pubblicazione: (2026)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
di: Lin, Tao, et al.
Pubblicazione: (2025)
di: Lin, Tao, et al.
Pubblicazione: (2025)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
di: Li, Haosheng, et al.
Pubblicazione: (2026)
di: Li, Haosheng, et al.
Pubblicazione: (2026)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
di: Wang, Yating, et al.
Pubblicazione: (2025) -
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2026) -
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
di: Wang, Hanzhen, et al.
Pubblicazione: (2025) -
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
di: Liang, Wenqi, et al.
Pubblicazione: (2025) -
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)