Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Fan, Yiguo, Ding, Pengxiang, Bai, Shuanghao, Tong, Xinyang, Zhu, Yuyang, Lu, Hongchao, Dai, Fengqi, Zhao, Wei, Liu, Yang, Huang, Siteng, Fan, Zhaoxin, Chen, Badong, Wang, Donglin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation
por: Bai, Shuanghao, et al.
Publicado: (2025)
por: Bai, Shuanghao, et al.
Publicado: (2025)
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025)
por: Lin, Minghui, et al.
Publicado: (2025)
Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration
por: Ding, Pengxiang, et al.
Publicado: (2025)
por: Ding, Pengxiang, et al.
Publicado: (2025)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning
por: Wang, Ruiheng, et al.
Publicado: (2026)
por: Wang, Ruiheng, et al.
Publicado: (2026)
Prompt-based Distribution Alignment for Unsupervised Domain Adaptation
por: Bai, Shuanghao, et al.
Publicado: (2023)
por: Bai, Shuanghao, et al.
Publicado: (2023)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
por: Tong, Xinyang, et al.
Publicado: (2024)
por: Tong, Xinyang, et al.
Publicado: (2024)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
por: Wang, Yihao, et al.
Publicado: (2025)
por: Wang, Yihao, et al.
Publicado: (2025)
ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning
por: Zhang, Hongyin, et al.
Publicado: (2025)
por: Zhang, Hongyin, et al.
Publicado: (2025)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
por: Hu, Yucheng, et al.
Publicado: (2026)
por: Hu, Yucheng, et al.
Publicado: (2026)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation
por: Jia, Bofang, et al.
Publicado: (2024)
por: Jia, Bofang, et al.
Publicado: (2024)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
por: Gong, Zhefei, et al.
Publicado: (2024)
por: Gong, Zhefei, et al.
Publicado: (2024)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation
por: Zhang, Haoran, et al.
Publicado: (2025)
por: Zhang, Haoran, et al.
Publicado: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
CUBic: Coordinated Unified Bimanual Perception and Control Framework
por: Wang, Xingyu, et al.
Publicado: (2026)
por: Wang, Xingyu, et al.
Publicado: (2026)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
por: Yang, Ran, et al.
Publicado: (2025)
por: Yang, Ran, et al.
Publicado: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
por: Bai, Shuanghao, et al.
Publicado: (2025)
por: Bai, Shuanghao, et al.
Publicado: (2025)
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
por: Liu, Isabella, et al.
Publicado: (2026)
por: Liu, Isabella, et al.
Publicado: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey
por: Bai, Shuanghao, et al.
Publicado: (2025)
por: Bai, Shuanghao, et al.
Publicado: (2025)
IG-RFT: An Interaction-Guided RL Framework for VLA Models in Long-Horizon Robotic Manipulation
por: Su, Zhian, et al.
Publicado: (2026)
por: Su, Zhian, et al.
Publicado: (2026)
Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective
por: Zhou, Wanqi, et al.
Publicado: (2024)
por: Zhou, Wanqi, et al.
Publicado: (2024)
Learning Long-Horizon Robot Manipulation Skills via Privileged Action
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
por: Shi, Hao, et al.
Publicado: (2025)
por: Shi, Hao, et al.
Publicado: (2025)
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
por: Chen, Xueyao, et al.
Publicado: (2026)
por: Chen, Xueyao, et al.
Publicado: (2026)
LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
por: Wang, Xiaofan, et al.
Publicado: (2025)
por: Wang, Xiaofan, et al.
Publicado: (2025)
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
por: Yang, Yue, et al.
Publicado: (2026)
por: Yang, Yue, et al.
Publicado: (2026)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
por: Zhou, Hui, et al.
Publicado: (2025)
por: Zhou, Hui, et al.
Publicado: (2025)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2026)
por: Tan, Huajie, et al.
Publicado: (2026)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
por: Li, Hengtao, et al.
Publicado: (2025)
por: Li, Hengtao, et al.
Publicado: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
Ejemplares similares
-
Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation
por: Bai, Shuanghao, et al.
Publicado: (2025) -
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
por: Zhao, Wei, et al.
Publicado: (2025) -
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
por: Cui, Can, et al.
Publicado: (2025) -
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023) -
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025)