STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Yuxuan, Jin, Yurun, Yu, Bin, Shi, Yukun, Wu, Hao, Liu, Chi Harold, Chen, Kai, Huang, Cong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation
di: Lian, Shijie, et al.
Pubblicazione: (2026)
di: Lian, Shijie, et al.
Pubblicazione: (2026)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
di: Zhu, Juan, et al.
Pubblicazione: (2026)
di: Zhu, Juan, et al.
Pubblicazione: (2026)
PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
di: Lin, Xiaopeng, et al.
Pubblicazione: (2025)
di: Lin, Xiaopeng, et al.
Pubblicazione: (2025)
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
di: Lv, Qi, et al.
Pubblicazione: (2025)
di: Lv, Qi, et al.
Pubblicazione: (2025)
ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance
di: Li, Ying, et al.
Pubblicazione: (2025)
di: Li, Ying, et al.
Pubblicazione: (2025)
OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
di: Pan, Mingjie, et al.
Pubblicazione: (2025)
di: Pan, Mingjie, et al.
Pubblicazione: (2025)
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
di: Huang, Helong, et al.
Pubblicazione: (2025)
di: Huang, Helong, et al.
Pubblicazione: (2025)
SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
di: Zhou, Pengfei, et al.
Pubblicazione: (2026)
di: Zhou, Pengfei, et al.
Pubblicazione: (2026)
Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation
di: Chen, Haonan, et al.
Pubblicazione: (2025)
di: Chen, Haonan, et al.
Pubblicazione: (2025)
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
di: Liu, Yushan, et al.
Pubblicazione: (2026)
di: Liu, Yushan, et al.
Pubblicazione: (2026)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
di: Jiang, Zhennan, et al.
Pubblicazione: (2025)
di: Jiang, Zhennan, et al.
Pubblicazione: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
di: Feng, Qiuxuan, et al.
Pubblicazione: (2026)
di: Feng, Qiuxuan, et al.
Pubblicazione: (2026)
World Models for Robotic Manipulation: A Survey
di: Wang, Fangyuan, et al.
Pubblicazione: (2026)
di: Wang, Fangyuan, et al.
Pubblicazione: (2026)
Unified Learning of Temporal Task Structure and Action Timing for Bimanual Robot Manipulation
di: Dreher, Christian, et al.
Pubblicazione: (2026)
di: Dreher, Christian, et al.
Pubblicazione: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
di: Peng, Xiongfeng, et al.
Pubblicazione: (2026)
di: Peng, Xiongfeng, et al.
Pubblicazione: (2026)
EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric Flow
di: Chen, Yixiang, et al.
Pubblicazione: (2025)
di: Chen, Yixiang, et al.
Pubblicazione: (2025)
What Foundation Models can Bring for Robot Learning in Manipulation : A Survey
di: Li, Dingzhe, et al.
Pubblicazione: (2024)
di: Li, Dingzhe, et al.
Pubblicazione: (2024)
Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffusion Policies
di: Hao, Ce, et al.
Pubblicazione: (2026)
di: Hao, Ce, et al.
Pubblicazione: (2026)
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
di: Zheng, Yuhang, et al.
Pubblicazione: (2026)
di: Zheng, Yuhang, et al.
Pubblicazione: (2026)
GravMAD: Grounded Spatial Value Maps Guided Action Diffusion for Generalized 3D Manipulation
di: Chen, Yangtao, et al.
Pubblicazione: (2024)
di: Chen, Yangtao, et al.
Pubblicazione: (2024)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
Object-Centric Kinodynamic Planning for Nonprehensile Robot Rearrangement Manipulation
di: Ren, Kejia, et al.
Pubblicazione: (2024)
di: Ren, Kejia, et al.
Pubblicazione: (2024)
Language-Grounded Decoupled Action Representation for Robotic Manipulation
di: Weng, Wuding, et al.
Pubblicazione: (2026)
di: Weng, Wuding, et al.
Pubblicazione: (2026)
Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation
di: Yao, Xiangtong, et al.
Pubblicazione: (2023)
di: Yao, Xiangtong, et al.
Pubblicazione: (2023)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2026)
di: Tan, Huajie, et al.
Pubblicazione: (2026)
MOVE: A Simple Motion-Based Data Collection Paradigm for Spatial Generalization in Robotic Manipulation
di: Wang, Huanqian, et al.
Pubblicazione: (2025)
di: Wang, Huanqian, et al.
Pubblicazione: (2025)
StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement
di: Li, Kerui, et al.
Pubblicazione: (2026)
di: Li, Kerui, et al.
Pubblicazione: (2026)
Learning Robot Manipulation from Audio World Models
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
Disentangled Object-Centric Image Representation for Robotic Manipulation
di: Emukpere, David, et al.
Pubblicazione: (2025)
di: Emukpere, David, et al.
Pubblicazione: (2025)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026)
di: Sun, Jianli, et al.
Pubblicazione: (2026)
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
di: Cai, Junhao, et al.
Pubblicazione: (2026)
di: Cai, Junhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026) -
IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation
di: Lian, Shijie, et al.
Pubblicazione: (2026) -
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025) -
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
di: Zhu, Juan, et al.
Pubblicazione: (2026) -
PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
di: Lin, Xiaopeng, et al.
Pubblicazione: (2025)