Learning Visual Feature-Based World Models via Residual Latent Action
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xinyu, Xu, Zhengtong, Tao, Yutian, Wang, Yeping, She, Yu, Boularias, Abdeslam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VILP: Imitation Learning with Latent Video Planning
di: Xu, Zhengtong, et al.
Pubblicazione: (2025)
di: Xu, Zhengtong, et al.
Pubblicazione: (2025)
Motion Blender Gaussian Splatting for Dynamic Scene Reconstruction
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
DAP: Diffusion-based Affordance Prediction for Multi-modality Storage
di: Chang, Haonan, et al.
Pubblicazione: (2024)
di: Chang, Haonan, et al.
Pubblicazione: (2024)
UNIC: Learning Unified Multimodal Extrinsic Contact Estimation
di: Xu, Zhengtong, et al.
Pubblicazione: (2026)
di: Xu, Zhengtong, et al.
Pubblicazione: (2026)
One-Shot Imitation Learning with Invariance Matching for Robotic Manipulation
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
Bounding Distributional Shifts in World Modeling through Novelty Detection
di: Jing, Eric, et al.
Pubblicazione: (2025)
di: Jing, Eric, et al.
Pubblicazione: (2025)
DiLA: Disentangled Latent Action World Models
di: Zhang, Tianqiu, et al.
Pubblicazione: (2026)
di: Zhang, Tianqiu, et al.
Pubblicazione: (2026)
AdaWorld: Learning Adaptable World Models with Latent Actions
di: Gao, Shenyuan, et al.
Pubblicazione: (2025)
di: Gao, Shenyuan, et al.
Pubblicazione: (2025)
Scaling Manipulation Learning with Visual Kinematic Chain Prediction
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
di: Chen, Yi, et al.
Pubblicazione: (2026)
di: Chen, Yi, et al.
Pubblicazione: (2026)
Detect Everything with Few Examples
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
Latent Action Pretraining Through World Modeling
di: Tharwat, Bahey, et al.
Pubblicazione: (2025)
di: Tharwat, Bahey, et al.
Pubblicazione: (2025)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
Autoregressive Action Sequence Learning for Robotic Manipulation
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)
Chain of World: World Model Thinking in Latent Motion
di: Yang, Fuxiang, et al.
Pubblicazione: (2026)
di: Yang, Fuxiang, et al.
Pubblicazione: (2026)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
di: Liu, Chenyv, et al.
Pubblicazione: (2026)
di: Liu, Chenyv, et al.
Pubblicazione: (2026)
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
di: Wang, Linbo, et al.
Pubblicazione: (2026)
di: Wang, Linbo, et al.
Pubblicazione: (2026)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
di: Dong, Yifei, et al.
Pubblicazione: (2025)
di: Dong, Yifei, et al.
Pubblicazione: (2025)
Language-Conditioned World Modeling for Visual Navigation
di: Dong, Yifei, et al.
Pubblicazione: (2026)
di: Dong, Yifei, et al.
Pubblicazione: (2026)
Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots
di: Zhang, Lijun, et al.
Pubblicazione: (2026)
di: Zhang, Lijun, et al.
Pubblicazione: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
LeTac-MPC: Learning Model Predictive Control for Tactile-reactive Grasping
di: Xu, Zhengtong, et al.
Pubblicazione: (2024)
di: Xu, Zhengtong, et al.
Pubblicazione: (2024)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
di: Kim, Dongwon, et al.
Pubblicazione: (2026)
di: Kim, Dongwon, et al.
Pubblicazione: (2026)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
di: jia, Feiyang, et al.
Pubblicazione: (2026)
di: jia, Feiyang, et al.
Pubblicazione: (2026)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
di: Kim, Jisoo, et al.
Pubblicazione: (2026)
di: Kim, Jisoo, et al.
Pubblicazione: (2026)
From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
di: Zhou, Yang, et al.
Pubblicazione: (2026)
di: Zhou, Yang, et al.
Pubblicazione: (2026)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
Failure Forecasting Boosts Robustness of Sim2Real Rhythmic Insertion Policies
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
Sparse Imagination for Efficient Visual World Model Planning
di: Chun, Junha, et al.
Pubblicazione: (2025)
di: Chun, Junha, et al.
Pubblicazione: (2025)
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
Motus: A Unified Latent Action World Model
di: Bi, Hongzhe, et al.
Pubblicazione: (2025)
di: Bi, Hongzhe, et al.
Pubblicazione: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026)
di: Hao, Haihong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VILP: Imitation Learning with Latent Video Planning
di: Xu, Zhengtong, et al.
Pubblicazione: (2025) -
Motion Blender Gaussian Splatting for Dynamic Scene Reconstruction
di: Zhang, Xinyu, et al.
Pubblicazione: (2025) -
DAP: Diffusion-based Affordance Prediction for Multi-modality Storage
di: Chang, Haonan, et al.
Pubblicazione: (2024) -
UNIC: Learning Unified Multimodal Extrinsic Contact Estimation
di: Xu, Zhengtong, et al.
Pubblicazione: (2026) -
One-Shot Imitation Learning with Invariance Matching for Robotic Manipulation
di: Zhang, Xinyu, et al.
Pubblicazione: (2024)