World Guidance: World Modeling in Condition Space for Action Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Su, Yue, Chen, Sijin, Shi, Haixin, Liu, Mingyu, Zhang, Zhengshen, Huang, Ningyuan, Zhong, Weiheng, Zhu, Zhengbang, Liu, Yuxiao, Liu, Xihui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
por: Zhang, Zhengshen, et al.
Publicado: (2025)
por: Zhang, Zhengshen, et al.
Publicado: (2025)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
por: Chen, Yi, et al.
Publicado: (2026)
por: Chen, Yi, et al.
Publicado: (2026)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
Motus: A Unified Latent Action World Model
por: Bi, Hongzhe, et al.
Publicado: (2025)
por: Bi, Hongzhe, et al.
Publicado: (2025)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
por: Shang, Yu, et al.
Publicado: (2026)
por: Shang, Yu, et al.
Publicado: (2026)
MWM: Mobile World Models for Action-Conditioned Consistent Prediction
por: Yan, Han, et al.
Publicado: (2026)
por: Yan, Han, et al.
Publicado: (2026)
IRASim: A Fine-Grained World Model for Robot Manipulation
por: Zhu, Fangqi, et al.
Publicado: (2024)
por: Zhu, Fangqi, et al.
Publicado: (2024)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
por: Shang, Yu, et al.
Publicado: (2026)
por: Shang, Yu, et al.
Publicado: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
por: Sun, Jingwen, et al.
Publicado: (2026)
por: Sun, Jingwen, et al.
Publicado: (2026)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
por: Wang, Xinjie, et al.
Publicado: (2025)
por: Wang, Xinjie, et al.
Publicado: (2025)
Language-Conditioned World Modeling for Visual Navigation
por: Dong, Yifei, et al.
Publicado: (2026)
por: Dong, Yifei, et al.
Publicado: (2026)
World Action Models: The Next Frontier in Embodied AI
por: Wang, Siyin, et al.
Publicado: (2026)
por: Wang, Siyin, et al.
Publicado: (2026)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
por: Wang, Yating, et al.
Publicado: (2025)
por: Wang, Yating, et al.
Publicado: (2025)
ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation
por: Qin, Yiran, et al.
Publicado: (2026)
por: Qin, Yiran, et al.
Publicado: (2026)
LidarDM: Generative LiDAR Simulation in a Generated World
por: Zyrianov, Vlas, et al.
Publicado: (2024)
por: Zyrianov, Vlas, et al.
Publicado: (2024)
Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
por: Liu, Qiqi, et al.
Publicado: (2026)
por: Liu, Qiqi, et al.
Publicado: (2026)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
por: Shang, Shuyao, et al.
Publicado: (2026)
por: Shang, Shuyao, et al.
Publicado: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
por: Zhao, Baining, et al.
Publicado: (2026)
por: Zhao, Baining, et al.
Publicado: (2026)
Drift-Resistant Navigation World Model with Anchored Epipolar Guidance
por: Luan, Po-Chien, et al.
Publicado: (2026)
por: Luan, Po-Chien, et al.
Publicado: (2026)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
por: Liu, Chenyv, et al.
Publicado: (2026)
por: Liu, Chenyv, et al.
Publicado: (2026)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
por: Wang, Lirui, et al.
Publicado: (2025)
por: Wang, Lirui, et al.
Publicado: (2025)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
por: GigaBrain Team, et al.
Publicado: (2025)
por: GigaBrain Team, et al.
Publicado: (2025)
EnerVerse-AC: Envisioning Embodied Environments with Action Condition
por: Jiang, Yuxin, et al.
Publicado: (2025)
por: Jiang, Yuxin, et al.
Publicado: (2025)
Conditioning Latent-Space Clusters for Real-World Anomaly Classification
por: Bogdoll, Daniel, et al.
Publicado: (2023)
por: Bogdoll, Daniel, et al.
Publicado: (2023)
Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
por: Hu, Bin, et al.
Publicado: (2025)
por: Hu, Bin, et al.
Publicado: (2025)
RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World
por: Mao, Weixin, et al.
Publicado: (2024)
por: Mao, Weixin, et al.
Publicado: (2024)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
Latent Action Pretraining Through World Modeling
por: Tharwat, Bahey, et al.
Publicado: (2025)
por: Tharwat, Bahey, et al.
Publicado: (2025)
NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces
por: Huang, Zheng, et al.
Publicado: (2025)
por: Huang, Zheng, et al.
Publicado: (2025)
Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert
por: Liu, Mingyu, et al.
Publicado: (2025)
por: Liu, Mingyu, et al.
Publicado: (2025)
Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
por: Guo, Jun, et al.
Publicado: (2026)
por: Guo, Jun, et al.
Publicado: (2026)
ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks
por: Wang, Kaijun, et al.
Publicado: (2025)
por: Wang, Kaijun, et al.
Publicado: (2025)
Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
por: Chi, Haozhuang, et al.
Publicado: (2026)
por: Chi, Haozhuang, et al.
Publicado: (2026)
PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
por: Li, Ziwen, et al.
Publicado: (2025)
por: Li, Ziwen, et al.
Publicado: (2025)
VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs
por: Jiang, Chaokang, et al.
Publicado: (2026)
por: Jiang, Chaokang, et al.
Publicado: (2026)
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
por: Wei, Julong, et al.
Publicado: (2024)
por: Wei, Julong, et al.
Publicado: (2024)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects
por: Kreber, Jens U., et al.
Publicado: (2026)
por: Kreber, Jens U., et al.
Publicado: (2026)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
por: Han, Jianhua, et al.
Publicado: (2025)
por: Han, Jianhua, et al.
Publicado: (2025)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
por: Chai, Ying, et al.
Publicado: (2025)
por: Chai, Ying, et al.
Publicado: (2025)
Ejemplares similares
-
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
por: Zhang, Zhengshen, et al.
Publicado: (2025) -
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
por: Chen, Yi, et al.
Publicado: (2026) -
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026) -
Motus: A Unified Latent Action World Model
por: Bi, Hongzhe, et al.
Publicado: (2025) -
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
por: Shang, Yu, et al.
Publicado: (2026)