Universal Actions for Enhanced Embodied Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Jinliang, Li, Jianxiong, Liu, Dongxiu, Zheng, Yinan, Wang, Zhihao, Ou, Zhonghong, Liu, Yu, Liu, Jingjing, Zhang, Ya-Qin, Zhan, Xianyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Robotic Policy Learning via Latent Space Backward Planning
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
Demystifying Action Space Design for Robotic Manipulation Policies
di: Feng, Yuchun, et al.
Pubblicazione: (2026)
di: Feng, Yuchun, et al.
Pubblicazione: (2026)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
Instruction-Guided Visual Masking
di: Zheng, Jinliang, et al.
Pubblicazione: (2024)
di: Zheng, Jinliang, et al.
Pubblicazione: (2024)
PhysiAgent: An Embodied Agent Framework in Physical World
di: Wang, Zhihao, et al.
Pubblicazione: (2025)
di: Wang, Zhihao, et al.
Pubblicazione: (2025)
World Action Models: The Next Frontier in Embodied AI
di: Wang, Siyin, et al.
Pubblicazione: (2026)
di: Wang, Siyin, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
di: Wang, Xinjie, et al.
Pubblicazione: (2025)
di: Wang, Xinjie, et al.
Pubblicazione: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
di: Hao, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Hao, Xiaoshuai, et al.
Pubblicazione: (2025)
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
di: Liu, Dayong, et al.
Pubblicazione: (2025)
di: Liu, Dayong, et al.
Pubblicazione: (2025)
Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
di: Tan, Tianyi, et al.
Pubblicazione: (2025)
di: Tan, Tianyi, et al.
Pubblicazione: (2025)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
di: Fang, Zhen, et al.
Pubblicazione: (2025)
di: Fang, Zhen, et al.
Pubblicazione: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
EnerVerse-AC: Envisioning Embodied Environments with Action Condition
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
di: Qin, Jack, et al.
Pubblicazione: (2025)
di: Qin, Jack, et al.
Pubblicazione: (2025)
SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models
di: He, Ziheng, et al.
Pubblicazione: (2026)
di: He, Ziheng, et al.
Pubblicazione: (2026)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
IROAM: Improving Roadside Monocular 3D Object Detection Learning from Autonomous Vehicle Data Domain
di: Wang, Zhe, et al.
Pubblicazione: (2025)
di: Wang, Zhe, et al.
Pubblicazione: (2025)
DVPE: Divided View Position Embedding for Multi-View 3D Object Detection
di: Wang, Jiasen, et al.
Pubblicazione: (2024)
di: Wang, Jiasen, et al.
Pubblicazione: (2024)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
di: Ye, Angen, et al.
Pubblicazione: (2025)
di: Ye, Angen, et al.
Pubblicazione: (2025)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
di: Qian, Kangan, et al.
Pubblicazione: (2026)
di: Qian, Kangan, et al.
Pubblicazione: (2026)
Autoregressive Meta-Actions for Unified Controllable Trajectory Generation
di: Zhao, Jianbo, et al.
Pubblicazione: (2025)
di: Zhao, Jianbo, et al.
Pubblicazione: (2025)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
di: Chu, Zedong, et al.
Pubblicazione: (2026)
di: Chu, Zedong, et al.
Pubblicazione: (2026)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
di: Xu, Mutian, et al.
Pubblicazione: (2026)
di: Xu, Mutian, et al.
Pubblicazione: (2026)
Visual Environment-Interactive Planning for Embodied Complex-Question Answering
di: Lan, Ning, et al.
Pubblicazione: (2025)
di: Lan, Ning, et al.
Pubblicazione: (2025)
Embodied Navigation with Auxiliary Task of Action Description Prediction
di: Kondoh, Haru, et al.
Pubblicazione: (2025)
di: Kondoh, Haru, et al.
Pubblicazione: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
di: Lei, Zixing, et al.
Pubblicazione: (2026)
di: Lei, Zixing, et al.
Pubblicazione: (2026)
RoboAgent: Chaining Basic Capabilities for Embodied Task Planning
di: Xu, Peiran, et al.
Pubblicazione: (2026)
di: Xu, Peiran, et al.
Pubblicazione: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
Embodied Domain Adaptation for Object Detection
di: Shi, Xiangyu, et al.
Pubblicazione: (2025)
di: Shi, Xiangyu, et al.
Pubblicazione: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
di: Ding, Hongyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Efficient Robotic Policy Learning via Latent Space Backward Planning
di: Liu, Dongxiu, et al.
Pubblicazione: (2025) -
Demystifying Action Space Design for Robotic Manipulation Policies
di: Feng, Yuchun, et al.
Pubblicazione: (2026) -
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
di: Zheng, Jinliang, et al.
Pubblicazione: (2025) -
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024) -
Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024)