Autoregressive Meta-Actions for Unified Controllable Trajectory Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Jianbo, Ban, Taiyu, Wang, Xiyang, Zhou, Qibin, Zhou, Hangning, Liu, Zhihao, Yang, Mu, Liu, Lei, Li, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DRoPE: Directional Rotary Position Embedding for Efficient Agent Interaction Modeling
par: Zhao, Jianbo, et autres
Publié: (2025)
par: Zhao, Jianbo, et autres
Publié: (2025)
Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
par: Zhao, Jianbo, et autres
Publié: (2025)
par: Zhao, Jianbo, et autres
Publié: (2025)
KiGRAS: Kinematic-Driven Generative Model for Realistic Agent Simulation
par: Zhao, Jianbo, et autres
Publié: (2024)
par: Zhao, Jianbo, et autres
Publié: (2024)
StreamMOTP: Streaming and Unified Framework for Joint 3D Multi-Object Tracking and Trajectory Prediction
par: Zhuang, Jiaheng, et autres
Publié: (2024)
par: Zhuang, Jiaheng, et autres
Publié: (2024)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
par: Liu, Jiaming, et autres
Publié: (2025)
par: Liu, Jiaming, et autres
Publié: (2025)
Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation
par: Zhang, Wenbo, et autres
Publié: (2025)
par: Zhang, Wenbo, et autres
Publié: (2025)
ChainFlow-VLA: Causal Flow Planning with Vision-Language Models
par: Wang, Xiyang, et autres
Publié: (2026)
par: Wang, Xiyang, et autres
Publié: (2026)
MacFormer: Map-Agent Coupled Transformer for Real-time and Robust Trajectory Prediction
par: Feng, Chen, et autres
Publié: (2023)
par: Feng, Chen, et autres
Publié: (2023)
Unifying Language-Action Understanding and Generation for Autonomous Driving
par: Wang, Xinyang, et autres
Publié: (2026)
par: Wang, Xinyang, et autres
Publié: (2026)
MCTrack: A Unified 3D Multi-Object Tracking Framework for Autonomous Driving
par: Wang, Xiyang, et autres
Publié: (2024)
par: Wang, Xiyang, et autres
Publié: (2024)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning
par: Ji, Kangye, et autres
Publié: (2026)
par: Ji, Kangye, et autres
Publié: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
Fine-Grained Action Segmentation for Renorrhaphy in Robot-Assisted Partial Nephrectomy
par: Dai, Jiaheng, et autres
Publié: (2026)
par: Dai, Jiaheng, et autres
Publié: (2026)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
par: Wang, Lirui, et autres
Publié: (2025)
par: Wang, Lirui, et autres
Publié: (2025)
MetaTra: Meta-Learning for Generalized Trajectory Prediction in Unseen Domain
par: Li, Xiaohe, et autres
Publié: (2024)
par: Li, Xiaohe, et autres
Publié: (2024)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
par: Zhou, Jiaying, et autres
Publié: (2026)
par: Zhou, Jiaying, et autres
Publié: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
par: Li, Yongkang, et autres
Publié: (2026)
par: Li, Yongkang, et autres
Publié: (2026)
Motus: A Unified Latent Action World Model
par: Bi, Hongzhe, et autres
Publié: (2025)
par: Bi, Hongzhe, et autres
Publié: (2025)
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
par: Fu, Yiyang, et autres
Publié: (2026)
par: Fu, Yiyang, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
Unified Human Localization and Trajectory Prediction with Monocular Vision
par: Luan, Po-Chien, et autres
Publié: (2025)
par: Luan, Po-Chien, et autres
Publié: (2025)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
par: Zhou, Yang, et autres
Publié: (2026)
par: Zhou, Yang, et autres
Publié: (2026)
FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation
par: Kim, Seungwook, et autres
Publié: (2025)
par: Kim, Seungwook, et autres
Publié: (2025)
Precise Action-to-Video Generation Through Visual Action Prompts
par: Wang, Yuang, et autres
Publié: (2025)
par: Wang, Yuang, et autres
Publié: (2025)
Dense Policy: Bidirectional Autoregressive Learning of Actions
par: Su, Yue, et autres
Publié: (2025)
par: Su, Yue, et autres
Publié: (2025)
UGG: Unified Generative Grasping
par: Lu, Jiaxin, et autres
Publié: (2023)
par: Lu, Jiaxin, et autres
Publié: (2023)
Unified Video Action Model
par: Li, Shuang, et autres
Publié: (2025)
par: Li, Shuang, et autres
Publié: (2025)
UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
Structural Action Transformer for 3D Dexterous Manipulation
par: Lei, Xiaohan, et autres
Publié: (2026)
par: Lei, Xiaohan, et autres
Publié: (2026)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
par: Ye, Wencheng, et autres
Publié: (2025)
par: Ye, Wencheng, et autres
Publié: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
par: Lang, Xiaolei, et autres
Publié: (2026)
par: Lang, Xiaolei, et autres
Publié: (2026)
Demystifying Action Space Design for Robotic Manipulation Policies
par: Feng, Yuchun, et autres
Publié: (2026)
par: Feng, Yuchun, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting
par: Lin, Juyi, et autres
Publié: (2025)
par: Lin, Juyi, et autres
Publié: (2025)
Documents similaires
-
DRoPE: Directional Rotary Position Embedding for Efficient Agent Interaction Modeling
par: Zhao, Jianbo, et autres
Publié: (2025) -
Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
par: Zhao, Jianbo, et autres
Publié: (2025) -
KiGRAS: Kinematic-Driven Generative Model for Realistic Agent Simulation
par: Zhao, Jianbo, et autres
Publié: (2024) -
StreamMOTP: Streaming and Unified Framework for Joint 3D Multi-Object Tracking and Trajectory Prediction
par: Zhuang, Jiaheng, et autres
Publié: (2024) -
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
par: Liu, Jiaming, et autres
Publié: (2025)