BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Yucheng, Zhang, Jianke, Luo, Yuanfei, Guo, Yanjiang, Chen, Xiaoyu, Sun, Xinshu, Feng, Kun, Lu, Qingzhou, Chen, Sheng, Zhang, Yangang, Li, Wei, Chen, Jianyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
di: Zhang, Jianke, et al.
Pubblicazione: (2025)
di: Zhang, Jianke, et al.
Pubblicazione: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?
di: Zhang, Zhongru, et al.
Pubblicazione: (2026)
di: Zhang, Zhongru, et al.
Pubblicazione: (2026)
Improving Vision-Language-Action Model with Online Reinforcement Learning
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
Prediction with Action: Visual Policy Learning via Joint Denoising Process
di: Guo, Yanjiang, et al.
Pubblicazione: (2024)
di: Guo, Yanjiang, et al.
Pubblicazione: (2024)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
di: Zhang, Jianke, et al.
Pubblicazione: (2024)
di: Zhang, Jianke, et al.
Pubblicazione: (2024)
UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
di: Zhang, Jianke, et al.
Pubblicazione: (2025)
di: Zhang, Jianke, et al.
Pubblicazione: (2025)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
di: Chen, Xiaoyu, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyu, et al.
Pubblicazione: (2025)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
di: Hu, Yucheng, et al.
Pubblicazione: (2024)
di: Hu, Yucheng, et al.
Pubblicazione: (2024)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
di: Liu, Jinkun, et al.
Pubblicazione: (2026)
di: Liu, Jinkun, et al.
Pubblicazione: (2026)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
di: Yang, Ran, et al.
Pubblicazione: (2025)
di: Yang, Ran, et al.
Pubblicazione: (2025)
Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions
di: Fan, Cunxin, et al.
Pubblicazione: (2025)
di: Fan, Cunxin, et al.
Pubblicazione: (2025)
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
di: Liu, Isabella, et al.
Pubblicazione: (2026)
di: Liu, Isabella, et al.
Pubblicazione: (2026)
UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
di: Lu, Hao, et al.
Pubblicazione: (2025)
di: Lu, Hao, et al.
Pubblicazione: (2025)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
di: Zhu, Xiang, et al.
Pubblicazione: (2026)
di: Zhu, Xiang, et al.
Pubblicazione: (2026)
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
Learning Long-Horizon Robot Manipulation Skills via Privileged Action
di: Mao, Xiaofeng, et al.
Pubblicazione: (2025)
di: Mao, Xiaofeng, et al.
Pubblicazione: (2025)
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026)
di: Sun, Jianli, et al.
Pubblicazione: (2026)
TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation
di: Sun, Jun, et al.
Pubblicazione: (2026)
di: Sun, Jun, et al.
Pubblicazione: (2026)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
di: Jiang, Feng, et al.
Pubblicazione: (2025)
di: Jiang, Feng, et al.
Pubblicazione: (2025)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
di: Bian, Jinyue, et al.
Pubblicazione: (2025)
di: Bian, Jinyue, et al.
Pubblicazione: (2025)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models
di: Zhou, Zheyuan, et al.
Pubblicazione: (2026)
di: Zhou, Zheyuan, et al.
Pubblicazione: (2026)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
di: Chen, Qian, et al.
Pubblicazione: (2025)
di: Chen, Qian, et al.
Pubblicazione: (2025)
ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning
di: Gao, Jingyue, et al.
Pubblicazione: (2026)
di: Gao, Jingyue, et al.
Pubblicazione: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
di: Zhang, Kaidi, et al.
Pubblicazione: (2026)
di: Zhang, Kaidi, et al.
Pubblicazione: (2026)
GraSP-VLA: Graph-based Symbolic Action Representation for Long-Horizon Planning with VLA Policies
di: Neau, Maëlic, et al.
Pubblicazione: (2025)
di: Neau, Maëlic, et al.
Pubblicazione: (2025)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
di: Luo, Yuankai, et al.
Pubblicazione: (2026)
di: Luo, Yuankai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
di: Zhang, Jianke, et al.
Pubblicazione: (2026) -
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
di: Zhang, Jianke, et al.
Pubblicazione: (2025) -
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026) -
Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?
di: Zhang, Zhongru, et al.
Pubblicazione: (2026) -
Improving Vision-Language-Action Model with Online Reinforcement Learning
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)