Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment
Fuente:
arXiv
Guardado en:
| Autor principal: | Wang, Libo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FAST: Efficient Action Tokenization for Vision-Language-Action Models
por: Pertsch, Karl, et al.
Publicado: (2025)
por: Pertsch, Karl, et al.
Publicado: (2025)
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
por: Li, Runze, et al.
Publicado: (2026)
por: Li, Runze, et al.
Publicado: (2026)
Confidence Calibration in Vision-Language-Action Models
por: Zollo, Thomas P, et al.
Publicado: (2025)
por: Zollo, Thomas P, et al.
Publicado: (2025)
Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
por: Wu, Yilin, et al.
Publicado: (2025)
por: Wu, Yilin, et al.
Publicado: (2025)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
por: Chen, Xiaoyu, et al.
Publicado: (2025)
por: Chen, Xiaoyu, et al.
Publicado: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
por: Kim, Moo Jin, et al.
Publicado: (2024)
por: Kim, Moo Jin, et al.
Publicado: (2024)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
por: Torne, Marcel, et al.
Publicado: (2026)
por: Torne, Marcel, et al.
Publicado: (2026)
APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model
por: Lu, Yuanjie, et al.
Publicado: (2026)
por: Lu, Yuanjie, et al.
Publicado: (2026)
Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
por: Zhang, Zhilong, et al.
Publicado: (2026)
por: Zhang, Zhilong, et al.
Publicado: (2026)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
por: Zhang, Hongyin, et al.
Publicado: (2025)
por: Zhang, Hongyin, et al.
Publicado: (2025)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
por: Huang, Jialei, et al.
Publicado: (2025)
por: Huang, Jialei, et al.
Publicado: (2025)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
por: Xu, Charles, et al.
Publicado: (2026)
por: Xu, Charles, et al.
Publicado: (2026)
Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
por: Guan, Weifan, et al.
Publicado: (2025)
por: Guan, Weifan, et al.
Publicado: (2025)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
por: Hirose, Noriaki, et al.
Publicado: (2025)
por: Hirose, Noriaki, et al.
Publicado: (2025)
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
por: Shukor, Mustafa, et al.
Publicado: (2025)
por: Shukor, Mustafa, et al.
Publicado: (2025)
Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
por: Lyu, Mingyang, et al.
Publicado: (2025)
por: Lyu, Mingyang, et al.
Publicado: (2025)
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
por: Cai, Rui, et al.
Publicado: (2026)
por: Cai, Rui, et al.
Publicado: (2026)
Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models
por: Francis-Meretzki, Shelly, et al.
Publicado: (2026)
por: Francis-Meretzki, Shelly, et al.
Publicado: (2026)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
por: Black, Kevin, et al.
Publicado: (2024)
por: Black, Kevin, et al.
Publicado: (2024)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
por: Intelligence, Physical, et al.
Publicado: (2025)
por: Intelligence, Physical, et al.
Publicado: (2025)
VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
por: Bi, Jianxin, et al.
Publicado: (2025)
por: Bi, Jianxin, et al.
Publicado: (2025)
Few-Shot Vision-Language Action-Incremental Policy Learning
por: Song, Mingchen, et al.
Publicado: (2025)
por: Song, Mingchen, et al.
Publicado: (2025)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
por: Driess, Danny, et al.
Publicado: (2025)
por: Driess, Danny, et al.
Publicado: (2025)
Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning
por: Hu, Jiaheng, et al.
Publicado: (2026)
por: Hu, Jiaheng, et al.
Publicado: (2026)
Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust
por: Hancock, Asher J., et al.
Publicado: (2024)
por: Hancock, Asher J., et al.
Publicado: (2024)
From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models
por: Li, Zhuofan, et al.
Publicado: (2026)
por: Li, Zhuofan, et al.
Publicado: (2026)
Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
por: Robotics, Tommoro, et al.
Publicado: (2026)
por: Robotics, Tommoro, et al.
Publicado: (2026)
DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
Understanding Asynchronous Inference Methods for Vision-Language-Action Models
por: Agouzoul, Ayoub
Publicado: (2026)
por: Agouzoul, Ayoub
Publicado: (2026)
Bridging Language, Vision and Action: Multimodal VAEs in Robotic Manipulation Tasks
por: Sejnova, Gabriela, et al.
Publicado: (2024)
por: Sejnova, Gabriela, et al.
Publicado: (2024)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
por: Xiong, Zheng, et al.
Publicado: (2025)
por: Xiong, Zheng, et al.
Publicado: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)
por: Zeng, Qixin, et al.
Publicado: (2026)
Continuous Reasoning for Vision-Language-Action
por: Wu, Yueh-Hua, et al.
Publicado: (2026)
por: Wu, Yueh-Hua, et al.
Publicado: (2026)
TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
por: Im, Hokyun, et al.
Publicado: (2025)
por: Im, Hokyun, et al.
Publicado: (2025)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
por: Yin, Cheng, et al.
Publicado: (2025)
por: Yin, Cheng, et al.
Publicado: (2025)
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
por: Wang, Zehao, et al.
Publicado: (2026)
por: Wang, Zehao, et al.
Publicado: (2026)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
por: Huang, Dongchi, et al.
Publicado: (2025)
por: Huang, Dongchi, et al.
Publicado: (2025)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
Verifier-free Test-Time Sampling for Vision Language Action Models
por: Jang, Suhyeok, et al.
Publicado: (2025)
por: Jang, Suhyeok, et al.
Publicado: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
por: Jin, Ruofan, et al.
Publicado: (2026)
por: Jin, Ruofan, et al.
Publicado: (2026)
Ejemplares similares
-
FAST: Efficient Action Tokenization for Vision-Language-Action Models
por: Pertsch, Karl, et al.
Publicado: (2025) -
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
por: Li, Runze, et al.
Publicado: (2026) -
Confidence Calibration in Vision-Language-Action Models
por: Zollo, Thomas P, et al.
Publicado: (2025) -
Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
por: Wu, Yilin, et al.
Publicado: (2025) -
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
por: Chen, Xiaoyu, et al.
Publicado: (2025)