HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Qiuxuan, Yu, Jiale, Liu, Jiaming, Jia, Yueru, Wu, Zhuangzhe, Chen, Hao, Qian, Zezhong, Gu, Shuo, Jia, Peng, Ma, Siwei, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
by: Luo, Yulin, et al.
Published: (2026)
by: Luo, Yulin, et al.
Published: (2026)
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
by: Liu, Yushan, et al.
Published: (2026)
by: Liu, Yushan, et al.
Published: (2026)
HarmoVid: Relightful Video Portrait Harmonization
by: Choi, Jun Myeong, et al.
Published: (2026)
by: Choi, Jun Myeong, et al.
Published: (2026)
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
by: Fu, Yankai, et al.
Published: (2025)
by: Fu, Yankai, et al.
Published: (2025)
JailWAM: Jailbreaking World Action Models in Robot Control
by: Liu, Hanqing, et al.
Published: (2026)
by: Liu, Hanqing, et al.
Published: (2026)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
by: Wang, Linbo, et al.
Published: (2026)
by: Wang, Linbo, et al.
Published: (2026)
EmpathyAgent: Can Embodied Agents Conduct Empathetic Actions?
by: Chen, Xinyan, et al.
Published: (2025)
by: Chen, Xinyan, et al.
Published: (2025)
WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
by: Qian, Zezhong, et al.
Published: (2025)
by: Qian, Zezhong, et al.
Published: (2025)
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
by: Xu, Qinwen, et al.
Published: (2026)
by: Xu, Qinwen, et al.
Published: (2026)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
by: Han, Jianhua, et al.
Published: (2025)
by: Han, Jianhua, et al.
Published: (2025)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
by: Chen, Anthony, et al.
Published: (2025)
by: Chen, Anthony, et al.
Published: (2025)
HarmoQ: Harmonized Post-Training Quantization for High-Fidelity Image
by: Wang, Hongjun, et al.
Published: (2025)
by: Wang, Hongjun, et al.
Published: (2025)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
by: Jia, Yueru, et al.
Published: (2024)
by: Jia, Yueru, et al.
Published: (2024)
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
by: Chen, Hao, et al.
Published: (2026)
by: Chen, Hao, et al.
Published: (2026)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
by: Zeng, Haoxi, et al.
Published: (2025)
by: Zeng, Haoxi, et al.
Published: (2025)
CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models
by: Jiang, Yuhua, et al.
Published: (2026)
by: Jiang, Yuhua, et al.
Published: (2026)
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
by: Yuan, Tianyuan, et al.
Published: (2026)
by: Yuan, Tianyuan, et al.
Published: (2026)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
by: Fang, Zhen, et al.
Published: (2025)
by: Fang, Zhen, et al.
Published: (2025)
ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
by: Lu, Dekun, et al.
Published: (2025)
by: Lu, Dekun, et al.
Published: (2025)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
by: Shi, Chen, et al.
Published: (2026)
by: Shi, Chen, et al.
Published: (2026)
DesignEdit: Multi-Layered Latent Decomposition and Fusion for Unified & Accurate Image Editing
by: Jia, Yueru, et al.
Published: (2024)
by: Jia, Yueru, et al.
Published: (2024)
HarmoGS: Robust 3D Gaussian Splatting in the Wild via Conflict-Aware Gradient Harmonization
by: Kang, Yulei, et al.
Published: (2026)
by: Kang, Yulei, et al.
Published: (2026)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
by: Chen, Sixiang, et al.
Published: (2025)
by: Chen, Sixiang, et al.
Published: (2025)
ASGDiffusion: Parallel High-Resolution Generation with Asynchronous Structure Guidance
by: Li, Yuming, et al.
Published: (2024)
by: Li, Yuming, et al.
Published: (2024)
WoW: Towards a World omniscient World model Through Embodied Interaction
by: Chi, Xiaowei, et al.
Published: (2025)
by: Chi, Xiaowei, et al.
Published: (2025)
ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance
by: Li, Ying, et al.
Published: (2025)
by: Li, Ying, et al.
Published: (2025)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
by: Gu, Chenyang, et al.
Published: (2025)
by: Gu, Chenyang, et al.
Published: (2025)
RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
by: Heng, Liang, et al.
Published: (2025)
by: Heng, Liang, et al.
Published: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
by: Liu, Zhuoyang, et al.
Published: (2025)
by: Liu, Zhuoyang, et al.
Published: (2025)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
by: Hou, Chengkai, et al.
Published: (2025)
by: Hou, Chengkai, et al.
Published: (2025)
Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
by: Jia, Yueru, et al.
Published: (2025)
by: Jia, Yueru, et al.
Published: (2025)
URDF-Anything+: End-to-End Generation for Simulation-Ready Articulated Assets
by: Wu, Zhuangzhe, et al.
Published: (2026)
by: Wu, Zhuangzhe, et al.
Published: (2026)
DyWA: Dynamics-adaptive World Action Model for Generalizable Non-prehensile Manipulation
by: Lyu, Jiangran, et al.
Published: (2025)
by: Lyu, Jiangran, et al.
Published: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
by: Liu, Jiaming, et al.
Published: (2024)
by: Liu, Jiaming, et al.
Published: (2024)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
by: Li, Xiaoqi, et al.
Published: (2025)
by: Li, Xiaoqi, et al.
Published: (2025)
TLA: Tactile-Language-Action Model for Contact-Rich Manipulation
by: Hao, Peng, et al.
Published: (2025)
by: Hao, Peng, et al.
Published: (2025)
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
by: Zhang, Chaofan, et al.
Published: (2025)
by: Zhang, Chaofan, et al.
Published: (2025)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
by: Ma, Teli, et al.
Published: (2026)
by: Ma, Teli, et al.
Published: (2026)
Skill-Aware Diffusion for Generalizable Robotic Manipulation
by: Huang, Aoshen, et al.
Published: (2026)
by: Huang, Aoshen, et al.
Published: (2026)
Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
Similar Items
-
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
by: Luo, Yulin, et al.
Published: (2026) -
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
by: Liu, Yushan, et al.
Published: (2026) -
HarmoVid: Relightful Video Portrait Harmonization
by: Choi, Jun Myeong, et al.
Published: (2026) -
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
by: Fu, Yankai, et al.
Published: (2025) -
JailWAM: Jailbreaking World Action Models in Robot Control
by: Liu, Hanqing, et al.
Published: (2026)