CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Chenyang, Yang, Guangyu, Lu, Kai, Xu, Shitong, Byrne, Bill, Trigoni, Niki, Markham, Andrew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
COOPERA: Continual Open-Ended Human-Robot Assistance
di: Ma, Chenyang, et al.
Pubblicazione: (2025)
di: Ma, Chenyang, et al.
Pubblicazione: (2025)
Dusk Till Dawn: Self-supervised Nighttime Stereo Depth Estimation using Visual Foundation Models
di: Vankadari, Madhu, et al.
Pubblicazione: (2024)
di: Vankadari, Madhu, et al.
Pubblicazione: (2024)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025)
di: Xu, Shitong, et al.
Pubblicazione: (2025)
Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization
di: Yang, Yiyuan, et al.
Pubblicazione: (2025)
di: Yang, Yiyuan, et al.
Pubblicazione: (2025)
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
di: Yang, Guangyu, et al.
Pubblicazione: (2023)
di: Yang, Guangyu, et al.
Pubblicazione: (2023)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
di: Ma, Chenyang, et al.
Pubblicazione: (2024)
di: Ma, Chenyang, et al.
Pubblicazione: (2024)
Pre-training Feature Guided Diffusion Model for Speech Enhancement
di: Yang, Yiyuan, et al.
Pubblicazione: (2024)
di: Yang, Yiyuan, et al.
Pubblicazione: (2024)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
di: Peng, Zhenghao "Mark", et al.
Pubblicazione: (2025)
di: Peng, Zhenghao "Mark", et al.
Pubblicazione: (2025)
FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
di: Sun, Nan, et al.
Pubblicazione: (2025)
di: Sun, Nan, et al.
Pubblicazione: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
SPEAR: Receiver-to-Receiver Acoustic Neural Warping Field
di: He, Yuhang, et al.
Pubblicazione: (2024)
di: He, Yuhang, et al.
Pubblicazione: (2024)
WSCLoc: Weakly-Supervised Sparse-View Camera Relocalization
di: Wang, Jialu, et al.
Pubblicazione: (2024)
di: Wang, Jialu, et al.
Pubblicazione: (2024)
Mitigating Cognitive Bias in RLHF by Altering Rationality
di: Horter, Tiffany, et al.
Pubblicazione: (2026)
di: Horter, Tiffany, et al.
Pubblicazione: (2026)
MambaLoc: Efficient Camera Localisation via State Space Model
di: Wang, Jialu, et al.
Pubblicazione: (2024)
di: Wang, Jialu, et al.
Pubblicazione: (2024)
RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
di: Koo, Jiyeon, et al.
Pubblicazione: (2025)
di: Koo, Jiyeon, et al.
Pubblicazione: (2025)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026)
di: Sun, Jianli, et al.
Pubblicazione: (2026)
EdgeVLA: Efficient Vision-Language-Action Models
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
di: Zhang, Yichi, et al.
Pubblicazione: (2026)
di: Zhang, Yichi, et al.
Pubblicazione: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
di: Apanasevich, I., et al.
Pubblicazione: (2026)
di: Apanasevich, I., et al.
Pubblicazione: (2026)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
di: Liu, Chenyv, et al.
Pubblicazione: (2026)
di: Liu, Chenyv, et al.
Pubblicazione: (2026)
CoFreeVLA: Collision-Free Dual-Arm Manipulation via Vision-Language-Action Model and Risk Estimation
di: Zhai, Xuanran, et al.
Pubblicazione: (2026)
di: Zhai, Xuanran, et al.
Pubblicazione: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
di: Li, Boyu, et al.
Pubblicazione: (2026)
di: Li, Boyu, et al.
Pubblicazione: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
di: Hu, Yutong, et al.
Pubblicazione: (2026)
di: Hu, Yutong, et al.
Pubblicazione: (2026)
Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task
di: Suzuki, Kanata, et al.
Pubblicazione: (2025)
di: Suzuki, Kanata, et al.
Pubblicazione: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
di: Peng, Xiongfeng, et al.
Pubblicazione: (2026)
di: Peng, Xiongfeng, et al.
Pubblicazione: (2026)
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
COOPERA: Continual Open-Ended Human-Robot Assistance
di: Ma, Chenyang, et al.
Pubblicazione: (2025) -
Dusk Till Dawn: Self-supervised Nighttime Stereo Depth Estimation using Visual Foundation Models
di: Vankadari, Madhu, et al.
Pubblicazione: (2024) -
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025) -
Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization
di: Yang, Yiyuan, et al.
Pubblicazione: (2025) -
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
di: Yang, Guangyu, et al.
Pubblicazione: (2023)