Learning Additively Compositional Latent Actions for Embodied AI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Hangxing, Chen, Xiaoyu, Zhang, Chuheng, Pearce, Tim, Chen, Jianyu, Lamb, Alex, Zhao, Li, Bian, Jiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
par: Zhang, Jianke, et autres
Publié: (2025)
par: Zhang, Jianke, et autres
Publié: (2025)
What Do Latent Action Models Actually Learn?
par: Zhang, Chuheng, et autres
Publié: (2025)
par: Zhang, Chuheng, et autres
Publié: (2025)
Latent Action Control for Reasoning-Guided Unified Image Generation
par: Zhai, Fuxiang, et autres
Publié: (2026)
par: Zhai, Fuxiang, et autres
Publié: (2026)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
Feature Corrective Transfer Learning: End-to-End Solutions to Object Detection in Non-Ideal Visual Conditions
par: Wei, Chuheng, et autres
Publié: (2024)
par: Wei, Chuheng, et autres
Publié: (2024)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
par: Guo, Junliang, et autres
Publié: (2025)
par: Guo, Junliang, et autres
Publié: (2025)
Object-Centric Latent Action Learning
par: Klepach, Albina, et autres
Publié: (2025)
par: Klepach, Albina, et autres
Publié: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026)
par: Garrido, Quentin, et autres
Publié: (2026)
Fast Autoregressive Video Generation with Diagonal Decoding
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks
par: Deng, Yueci, et autres
Publié: (2026)
par: Deng, Yueci, et autres
Publié: (2026)
SkateboardAI: The Coolest Video Action Recognition for Skateboarding
par: Chen, Hanxiao
Publié: (2023)
par: Chen, Hanxiao
Publié: (2023)
EmbRACE-3K: Embodied Reasoning and Action in Complex Environments
par: Lin, Mingxian, et autres
Publié: (2025)
par: Lin, Mingxian, et autres
Publié: (2025)
Universal Actions for Enhanced Embodied Foundation Models
par: Zheng, Jinliang, et autres
Publié: (2025)
par: Zheng, Jinliang, et autres
Publié: (2025)
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
par: Choi, Suhwan, et autres
Publié: (2025)
par: Choi, Suhwan, et autres
Publié: (2025)
Self-Explainable Affordance Learning with Embodied Caption
par: Zhang, Zhipeng, et autres
Publié: (2024)
par: Zhang, Zhipeng, et autres
Publié: (2024)
VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
par: Ranjan, Ravi, et autres
Publié: (2026)
par: Ranjan, Ravi, et autres
Publié: (2026)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
par: Lei, Zixing, et autres
Publié: (2026)
par: Lei, Zixing, et autres
Publié: (2026)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
par: Mei, Xiaodong, et autres
Publié: (2026)
par: Mei, Xiaodong, et autres
Publié: (2026)
Towards Learning a Generalist Model for Embodied Navigation
par: Zheng, Duo, et autres
Publié: (2023)
par: Zheng, Duo, et autres
Publié: (2023)
The Role of Predictive Uncertainty and Diversity in Embodied AI and Robot Learning
par: Senanayake, Ransalu
Publié: (2024)
par: Senanayake, Ransalu
Publié: (2024)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
par: Zhong, Fangwei, et autres
Publié: (2024)
par: Zhong, Fangwei, et autres
Publié: (2024)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
par: Liu, Dongxu, et autres
Publié: (2025)
par: Liu, Dongxu, et autres
Publié: (2025)
Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation
par: Wang, Haoming, et autres
Publié: (2026)
par: Wang, Haoming, et autres
Publié: (2026)
COMBO: Compositional World Models for Embodied Multi-Agent Cooperation
par: Zhang, Hongxin, et autres
Publié: (2024)
par: Zhang, Hongxin, et autres
Publié: (2024)
AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning
par: Zha, Jirong, et autres
Publié: (2025)
par: Zha, Jirong, et autres
Publié: (2025)
Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising
par: Li, Huaqiu, et autres
Publié: (2025)
par: Li, Huaqiu, et autres
Publié: (2025)
Selective Visual Representations Improve Convergence and Generalization for Embodied AI
par: Eftekhar, Ainaz, et autres
Publié: (2023)
par: Eftekhar, Ainaz, et autres
Publié: (2023)
Towards Principled Representation Learning from Videos for Reinforcement Learning
par: Misra, Dipendra, et autres
Publié: (2024)
par: Misra, Dipendra, et autres
Publié: (2024)
Latent Action Learning Requires Supervision in the Presence of Distractors
par: Nikulin, Alexander, et autres
Publié: (2025)
par: Nikulin, Alexander, et autres
Publié: (2025)
EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
par: Chang, Jianlei, et autres
Publié: (2025)
par: Chang, Jianlei, et autres
Publié: (2025)
ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
par: Zhou, Weijie, et autres
Publié: (2025)
par: Zhou, Weijie, et autres
Publié: (2025)
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025)
par: Li, Jiaao, et autres
Publié: (2025)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
par: Zhang, Jianke, et autres
Publié: (2024)
par: Zhang, Jianke, et autres
Publié: (2024)
Olaf-World: Orienting Latent Actions for Video World Modeling
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
par: Tang, Zuojin, et autres
Publié: (2026)
par: Tang, Zuojin, et autres
Publié: (2026)
Beyond Pixel Histories: World Models with Persistent 3D State
par: Garcin, Samuel, et autres
Publié: (2026)
par: Garcin, Samuel, et autres
Publié: (2026)
Documents similaires
-
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
par: Zhang, Jianke, et autres
Publié: (2025) -
What Do Latent Action Models Actually Learn?
par: Zhang, Chuheng, et autres
Publié: (2025) -
Latent Action Control for Reasoning-Guided Unified Image Generation
par: Zhai, Fuxiang, et autres
Publié: (2026) -
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025) -
Feature Corrective Transfer Learning: End-to-End Solutions to Object Detection in Non-Ideal Visual Conditions
par: Wei, Chuheng, et autres
Publié: (2024)