TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Zhenyang, Gu, Yongchong, Zheng, Sixiao, Fu, Yanwei, Xue, Xiangyang, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
von: Liu, Zhenyang, et al.
Veröffentlicht: (2026)
von: Liu, Zhenyang, et al.
Veröffentlicht: (2026)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
von: Liu, Zhenyang, et al.
Veröffentlicht: (2025)
von: Liu, Zhenyang, et al.
Veröffentlicht: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
von: Cen, Jun, et al.
Veröffentlicht: (2025)
von: Cen, Jun, et al.
Veröffentlicht: (2025)
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
von: Wang, Runze, et al.
Veröffentlicht: (2026)
von: Wang, Runze, et al.
Veröffentlicht: (2026)
LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion
von: Zhang, Jinyu, et al.
Veröffentlicht: (2024)
von: Zhang, Jinyu, et al.
Veröffentlicht: (2024)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
von: Ye, Jinhui, et al.
Veröffentlicht: (2026)
von: Ye, Jinhui, et al.
Veröffentlicht: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
von: Zhou, Zhongyi, et al.
Veröffentlicht: (2025)
von: Zhou, Zhongyi, et al.
Veröffentlicht: (2025)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
TMR-VLA:Vision-Language-Action Model for Magnetic Motion Control of Tri-leg Silicone-based Soft Robot
von: Tang, Ruijie, et al.
Veröffentlicht: (2026)
von: Tang, Ruijie, et al.
Veröffentlicht: (2026)
SparseGrasp: Robotic Grasping via 3D Semantic Gaussian Splatting from Sparse Multi-View RGB Images
von: Yu, Junqiu, et al.
Veröffentlicht: (2024)
von: Yu, Junqiu, et al.
Veröffentlicht: (2024)
SCOOP'D: Learning Mixed-Liquid-Solid Scooping via Sim2Real Generative Policy
von: Wang, Kuanning, et al.
Veröffentlicht: (2025)
von: Wang, Kuanning, et al.
Veröffentlicht: (2025)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
von: Apanasevich, I., et al.
Veröffentlicht: (2026)
von: Apanasevich, I., et al.
Veröffentlicht: (2026)
PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance
von: Zheng, Yupeng, et al.
Veröffentlicht: (2026)
von: Zheng, Yupeng, et al.
Veröffentlicht: (2026)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
von: Wang, Qiuyue, et al.
Veröffentlicht: (2026)
von: Wang, Qiuyue, et al.
Veröffentlicht: (2026)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
von: jia, Feiyang, et al.
Veröffentlicht: (2026)
von: jia, Feiyang, et al.
Veröffentlicht: (2026)
RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model
von: Li, Shunlei, et al.
Veröffentlicht: (2024)
von: Li, Shunlei, et al.
Veröffentlicht: (2024)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
You Only Estimate Once: Unified, One-stage, Real-Time Category-level Articulated Object 6D Pose Estimation for Robotic Grasping
von: Huang, Jingshun, et al.
Veröffentlicht: (2025)
von: Huang, Jingshun, et al.
Veröffentlicht: (2025)
TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments
von: Huang, Zhiyu, et al.
Veröffentlicht: (2026)
von: Huang, Zhiyu, et al.
Veröffentlicht: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation
von: Yu, Xinglei, et al.
Veröffentlicht: (2026)
von: Yu, Xinglei, et al.
Veröffentlicht: (2026)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
von: Lin, Fanqi, et al.
Veröffentlicht: (2025)
von: Lin, Fanqi, et al.
Veröffentlicht: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
von: Jiang, Anqing, et al.
Veröffentlicht: (2025)
von: Jiang, Anqing, et al.
Veröffentlicht: (2025)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
von: Peng, Xiongfeng, et al.
Veröffentlicht: (2026)
von: Peng, Xiongfeng, et al.
Veröffentlicht: (2026)
Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
von: Liu, Zhenyang, et al.
Veröffentlicht: (2025)
von: Liu, Zhenyang, et al.
Veröffentlicht: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
von: Hirose, Noriaki, et al.
Veröffentlicht: (2025)
von: Hirose, Noriaki, et al.
Veröffentlicht: (2025)
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
von: Shukor, Mustafa, et al.
Veröffentlicht: (2025)
von: Shukor, Mustafa, et al.
Veröffentlicht: (2025)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
von: Zhong, Linqing, et al.
Veröffentlicht: (2026)
von: Zhong, Linqing, et al.
Veröffentlicht: (2026)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
von: Guo, Peizheng, et al.
Veröffentlicht: (2026)
von: Guo, Peizheng, et al.
Veröffentlicht: (2026)
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
von: Zhou, Pengfei, et al.
Veröffentlicht: (2026)
von: Zhou, Pengfei, et al.
Veröffentlicht: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
von: Wen, Yuqing, et al.
Veröffentlicht: (2025)
von: Wen, Yuqing, et al.
Veröffentlicht: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
von: Liu, Yang, et al.
Veröffentlicht: (2026)
von: Liu, Yang, et al.
Veröffentlicht: (2026)
OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer
von: Wang, Kuanning, et al.
Veröffentlicht: (2026)
von: Wang, Kuanning, et al.
Veröffentlicht: (2026)
Bi-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Dexterous Manipulations
von: Gbagbe, Koffivi Fidèle, et al.
Veröffentlicht: (2024)
von: Gbagbe, Koffivi Fidèle, et al.
Veröffentlicht: (2024)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
von: Fan, Yiguo, et al.
Veröffentlicht: (2025)
von: Fan, Yiguo, et al.
Veröffentlicht: (2025)
Sequential Multi-Object Grasping with One Dexterous Hand
von: He, Sicheng, et al.
Veröffentlicht: (2025)
von: He, Sicheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
von: Liu, Zhenyang, et al.
Veröffentlicht: (2026) -
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
von: Liu, Zhenyang, et al.
Veröffentlicht: (2025) -
RynnVLA-002: A Unified Vision-Language-Action and World Model
von: Cen, Jun, et al.
Veröffentlicht: (2025) -
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
von: Wang, Runze, et al.
Veröffentlicht: (2026) -
LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion
von: Zhang, Jinyu, et al.
Veröffentlicht: (2024)