LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Hao, Liu, Jiaming, Yan, Zhonghao, Han, Nuowei, Zhang, Renrui, Gu, Chenyang, Gao, Jialin, Guo, Ziyu, Qian, Siyuan, Wang, Yinxi, Jia, Peng, Zhang, Shanghang, Heng, Pheng-Ann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2025)
di: Chen, Hao, et al.
Pubblicazione: (2025)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
di: Guo, Ziyu, et al.
Pubblicazione: (2026)
di: Guo, Ziyu, et al.
Pubblicazione: (2026)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
di: Luo, Yuechen, et al.
Pubblicazione: (2026)
di: Luo, Yuechen, et al.
Pubblicazione: (2026)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
di: Guo, Ziyu, et al.
Pubblicazione: (2024)
di: Guo, Ziyu, et al.
Pubblicazione: (2024)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
di: Qi, Yu, et al.
Pubblicazione: (2026)
di: Qi, Yu, et al.
Pubblicazione: (2026)
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
Point Cloud Understanding via Attention-Driven Contrastive Learning
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
di: Wang, Jiaze, et al.
Pubblicazione: (2024)
di: Wang, Jiaze, et al.
Pubblicazione: (2024)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time Adaptation
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
di: Heng, Liang, et al.
Pubblicazione: (2025)
di: Heng, Liang, et al.
Pubblicazione: (2025)
Rethinking Intermediate Representation for VLM-based Robot Manipulation
di: Tang, Weiliang, et al.
Pubblicazione: (2025)
di: Tang, Weiliang, et al.
Pubblicazione: (2025)
A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
di: Luo, Yulin, et al.
Pubblicazione: (2026)
di: Luo, Yulin, et al.
Pubblicazione: (2026)
EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
di: Xing, Zhenghao, et al.
Pubblicazione: (2025)
di: Xing, Zhenghao, et al.
Pubblicazione: (2025)
Comprehensive Generative Replay for Task-Incremental Segmentation with Concurrent Appearance and Semantic Forgetting
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
PLanAR: Planning-Language-Grounded Agentic Reasoning for Robot Manipulation
di: Guo, Pengyuan, et al.
Pubblicazione: (2026)
di: Guo, Pengyuan, et al.
Pubblicazione: (2026)
HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
di: Feng, Qiuxuan, et al.
Pubblicazione: (2026)
di: Feng, Qiuxuan, et al.
Pubblicazione: (2026)
NTO3D: Neural Target Object 3D Reconstruction with Segment Anything
di: Wei, Xiaobao, et al.
Pubblicazione: (2023)
di: Wei, Xiaobao, et al.
Pubblicazione: (2023)
VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation
di: Zhao, Wentao, et al.
Pubblicazione: (2024)
di: Zhao, Wentao, et al.
Pubblicazione: (2024)
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
di: Shen, Zijun, et al.
Pubblicazione: (2026)
di: Shen, Zijun, et al.
Pubblicazione: (2026)
Di-BiLPS: Denoising induced Bidirectional Latent-PDE-Solver under Sparse Observations
di: Li, Zhonghao, et al.
Pubblicazione: (2026)
di: Li, Zhonghao, et al.
Pubblicazione: (2026)
Does Engram Do Memory Retrieval in Autoregressive Image Generation?
di: Wang, Jinghao, et al.
Pubblicazione: (2026)
di: Wang, Jinghao, et al.
Pubblicazione: (2026)
ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation
di: Ma, Chuanhao, et al.
Pubblicazione: (2026)
di: Ma, Chuanhao, et al.
Pubblicazione: (2026)
ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
di: Yuan, Yifu, et al.
Pubblicazione: (2025)
di: Yuan, Yifu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026) -
Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2025) -
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
di: Gu, Chenyang, et al.
Pubblicazione: (2025) -
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025) -
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
di: Chen, Sixiang, et al.
Pubblicazione: (2025)