ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
Fuente:
arXiv
Salvato in:
| Autori principali: | Jang, Huiwon, Yu, Sihyun, Kwon, Heeseung, Jeon, Hojin, Seo, Younggyo, Shin, Jinwoo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Representation Learning with Stochastic Frame Prediction
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
di: Kim, Dongyoung, et al.
Pubblicazione: (2025)
di: Kim, Dongyoung, et al.
Pubblicazione: (2025)
Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models
di: Kim, Dongyoung, et al.
Pubblicazione: (2026)
di: Kim, Dongyoung, et al.
Pubblicazione: (2026)
Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Reinforcement Learning
di: Seo, Younggyo, et al.
Pubblicazione: (2024)
di: Seo, Younggyo, et al.
Pubblicazione: (2024)
Verifier-free Test-Time Sampling for Vision Language Action Models
di: Jang, Suhyeok, et al.
Pubblicazione: (2025)
di: Jang, Suhyeok, et al.
Pubblicazione: (2025)
Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
di: Lee, Jimin, et al.
Pubblicazione: (2026)
di: Lee, Jimin, et al.
Pubblicazione: (2026)
Hierarchical Vision Language Action Model Using Success and Failure Demonstrations
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
di: Park, Jeongeun, et al.
Pubblicazione: (2025)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
di: Won, John, et al.
Pubblicazione: (2025)
di: Won, John, et al.
Pubblicazione: (2025)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
di: Hu, Yutong, et al.
Pubblicazione: (2026)
di: Hu, Yutong, et al.
Pubblicazione: (2026)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models
di: Sridhar, Kaustubh, et al.
Pubblicazione: (2025)
di: Sridhar, Kaustubh, et al.
Pubblicazione: (2025)
DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
di: Kim, Changyeon, et al.
Pubblicazione: (2025)
di: Kim, Changyeon, et al.
Pubblicazione: (2025)
KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition
di: Han, Gaoge, et al.
Pubblicazione: (2026)
di: Han, Gaoge, et al.
Pubblicazione: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
di: Ng, Chi Kit, et al.
Pubblicazione: (2025)
di: Ng, Chi Kit, et al.
Pubblicazione: (2025)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
di: Pan, Xu, et al.
Pubblicazione: (2026)
di: Pan, Xu, et al.
Pubblicazione: (2026)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
di: Jin, Ruofan, et al.
Pubblicazione: (2026)
di: Jin, Ruofan, et al.
Pubblicazione: (2026)
CRL-VLA: Continual Vision-Language-Action Learning
di: Zeng, Qixin, et al.
Pubblicazione: (2026)
di: Zeng, Qixin, et al.
Pubblicazione: (2026)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
di: Su, Taiyi, et al.
Pubblicazione: (2026)
di: Su, Taiyi, et al.
Pubblicazione: (2026)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
di: Hu, Xintong, et al.
Pubblicazione: (2026)
di: Hu, Xintong, et al.
Pubblicazione: (2026)
AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
di: Du, Zhiying, et al.
Pubblicazione: (2025)
di: Du, Zhiying, et al.
Pubblicazione: (2025)
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
di: Li, Jiashun, et al.
Pubblicazione: (2026)
di: Li, Jiashun, et al.
Pubblicazione: (2026)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations
di: Liu, Hanqing, et al.
Pubblicazione: (2025)
di: Liu, Hanqing, et al.
Pubblicazione: (2025)
Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model
di: Hu, Zhaofeng, et al.
Pubblicazione: (2025)
di: Hu, Zhaofeng, et al.
Pubblicazione: (2025)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
di: Xiong, Zheng, et al.
Pubblicazione: (2025)
di: Xiong, Zheng, et al.
Pubblicazione: (2025)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
di: Yin, Cheng, et al.
Pubblicazione: (2025)
di: Yin, Cheng, et al.
Pubblicazione: (2025)
Render and Diffuse: Aligning Image and Action Spaces for Diffusion-based Behaviour Cloning
di: Vosylius, Vitalis, et al.
Pubblicazione: (2024)
di: Vosylius, Vitalis, et al.
Pubblicazione: (2024)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
di: Wu, Yuze, et al.
Pubblicazione: (2025)
di: Wu, Yuze, et al.
Pubblicazione: (2025)
D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models
di: Guo, Yucheng, et al.
Pubblicazione: (2026)
di: Guo, Yucheng, et al.
Pubblicazione: (2026)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
di: Shen, Boyang, et al.
Pubblicazione: (2026)
di: Shen, Boyang, et al.
Pubblicazione: (2026)
Vision Language Models are In-Context Value Learners
di: Ma, Yecheng Jason, et al.
Pubblicazione: (2024)
di: Ma, Yecheng Jason, et al.
Pubblicazione: (2024)
DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping
di: Zhong, Yifan, et al.
Pubblicazione: (2025)
di: Zhong, Yifan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visual Representation Learning with Stochastic Frame Prediction
di: Jang, Huiwon, et al.
Pubblicazione: (2024) -
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
di: Kim, Dongyoung, et al.
Pubblicazione: (2025) -
Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction
di: Jang, Huiwon, et al.
Pubblicazione: (2024) -
RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models
di: Kim, Dongyoung, et al.
Pubblicazione: (2026) -
Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Reinforcement Learning
di: Seo, Younggyo, et al.
Pubblicazione: (2024)