HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Qiuxuan, Yu, Jiale, Liu, Jiaming, Jia, Yueru, Wu, Zhuangzhe, Chen, Hao, Qian, Zezhong, Gu, Shuo, Jia, Peng, Ma, Siwei, Zhang, Shanghang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
di: Luo, Yulin, et al.
Pubblicazione: (2026)
di: Luo, Yulin, et al.
Pubblicazione: (2026)
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
di: Liu, Yushan, et al.
Pubblicazione: (2026)
di: Liu, Yushan, et al.
Pubblicazione: (2026)
HarmoVid: Relightful Video Portrait Harmonization
di: Choi, Jun Myeong, et al.
Pubblicazione: (2026)
di: Choi, Jun Myeong, et al.
Pubblicazione: (2026)
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
di: Fu, Yankai, et al.
Pubblicazione: (2025)
di: Fu, Yankai, et al.
Pubblicazione: (2025)
JailWAM: Jailbreaking World Action Models in Robot Control
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
di: Wang, Linbo, et al.
Pubblicazione: (2026)
di: Wang, Linbo, et al.
Pubblicazione: (2026)
EmpathyAgent: Can Embodied Agents Conduct Empathetic Actions?
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
di: Qian, Zezhong, et al.
Pubblicazione: (2025)
di: Qian, Zezhong, et al.
Pubblicazione: (2025)
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
di: Han, Jianhua, et al.
Pubblicazione: (2025)
di: Han, Jianhua, et al.
Pubblicazione: (2025)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
di: Chen, Anthony, et al.
Pubblicazione: (2025)
di: Chen, Anthony, et al.
Pubblicazione: (2025)
HarmoQ: Harmonized Post-Training Quantization for High-Fidelity Image
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
di: Wang, Hongjun, et al.
Pubblicazione: (2025)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2026)
di: Chen, Hao, et al.
Pubblicazione: (2026)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models
di: Jiang, Yuhua, et al.
Pubblicazione: (2026)
di: Jiang, Yuhua, et al.
Pubblicazione: (2026)
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
di: Yuan, Tianyuan, et al.
Pubblicazione: (2026)
di: Yuan, Tianyuan, et al.
Pubblicazione: (2026)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
di: Fang, Zhen, et al.
Pubblicazione: (2025)
di: Fang, Zhen, et al.
Pubblicazione: (2025)
ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
di: Lu, Dekun, et al.
Pubblicazione: (2025)
di: Lu, Dekun, et al.
Pubblicazione: (2025)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2026)
di: Shi, Chen, et al.
Pubblicazione: (2026)
DesignEdit: Multi-Layered Latent Decomposition and Fusion for Unified & Accurate Image Editing
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
HarmoGS: Robust 3D Gaussian Splatting in the Wild via Conflict-Aware Gradient Harmonization
di: Kang, Yulei, et al.
Pubblicazione: (2026)
di: Kang, Yulei, et al.
Pubblicazione: (2026)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
ASGDiffusion: Parallel High-Resolution Generation with Asynchronous Structure Guidance
di: Li, Yuming, et al.
Pubblicazione: (2024)
di: Li, Yuming, et al.
Pubblicazione: (2024)
WoW: Towards a World omniscient World model Through Embodied Interaction
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance
di: Li, Ying, et al.
Pubblicazione: (2025)
di: Li, Ying, et al.
Pubblicazione: (2025)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
di: Heng, Liang, et al.
Pubblicazione: (2025)
di: Heng, Liang, et al.
Pubblicazione: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
di: Jia, Yueru, et al.
Pubblicazione: (2025)
di: Jia, Yueru, et al.
Pubblicazione: (2025)
URDF-Anything+: End-to-End Generation for Simulation-Ready Articulated Assets
di: Wu, Zhuangzhe, et al.
Pubblicazione: (2026)
di: Wu, Zhuangzhe, et al.
Pubblicazione: (2026)
DyWA: Dynamics-adaptive World Action Model for Generalizable Non-prehensile Manipulation
di: Lyu, Jiangran, et al.
Pubblicazione: (2025)
di: Lyu, Jiangran, et al.
Pubblicazione: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
TLA: Tactile-Language-Action Model for Contact-Rich Manipulation
di: Hao, Peng, et al.
Pubblicazione: (2025)
di: Hao, Peng, et al.
Pubblicazione: (2025)
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
di: Zhang, Chaofan, et al.
Pubblicazione: (2025)
di: Zhang, Chaofan, et al.
Pubblicazione: (2025)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
di: Ma, Teli, et al.
Pubblicazione: (2026)
di: Ma, Teli, et al.
Pubblicazione: (2026)
Skill-Aware Diffusion for Generalizable Robotic Manipulation
di: Huang, Aoshen, et al.
Pubblicazione: (2026)
di: Huang, Aoshen, et al.
Pubblicazione: (2026)
Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
di: Luo, Yulin, et al.
Pubblicazione: (2026) -
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
di: Liu, Yushan, et al.
Pubblicazione: (2026) -
HarmoVid: Relightful Video Portrait Harmonization
di: Choi, Jun Myeong, et al.
Pubblicazione: (2026) -
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
di: Fu, Yankai, et al.
Pubblicazione: (2025) -
JailWAM: Jailbreaking World Action Models in Robot Control
di: Liu, Hanqing, et al.
Pubblicazione: (2026)