Diffusion Transformer Policy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hou, Zhi, Zhang, Tianyi, Xiong, Yuwen, Pu, Hengjun, Zhao, Chengyang, Tong, Ronglei, Qiao, Yu, Dai, Jifeng, Chen, Yuntao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025)
par: Hou, Zhi, et autres
Publié: (2025)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
par: Zhang, Tianyi, et autres
Publié: (2025)
par: Zhang, Tianyi, et autres
Publié: (2025)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
par: Luo, Gen, et autres
Publié: (2025)
par: Luo, Gen, et autres
Publié: (2025)
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
par: Shang, Shuyao, et autres
Publié: (2025)
par: Shang, Shuyao, et autres
Publié: (2025)
big.LITTLE Vision Transformer for Efficient Visual Recognition
par: Guo, He, et autres
Publié: (2024)
par: Guo, He, et autres
Publié: (2024)
TaCOS: Task-Specific Camera Optimization with Simulation
par: Yan, Chengyang, et autres
Publié: (2024)
par: Yan, Chengyang, et autres
Publié: (2024)
Generalizable Humanoid Manipulation with 3D Diffusion Policies
par: Ze, Yanjie, et autres
Publié: (2024)
par: Ze, Yanjie, et autres
Publié: (2024)
On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
par: Wu, Yiming, et autres
Publié: (2025)
par: Wu, Yiming, et autres
Publié: (2025)
Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning
par: Ji, Kangye, et autres
Publié: (2026)
par: Ji, Kangye, et autres
Publié: (2026)
DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
par: Egbe, ThankGod, et autres
Publié: (2025)
par: Egbe, ThankGod, et autres
Publié: (2025)
Fast Visuomotor Policy for Robotic Manipulation
par: Jia, Jingkai, et autres
Publié: (2025)
par: Jia, Jingkai, et autres
Publié: (2025)
From Single Images to Motion Policies via Video-Generation Environment Representations
par: Zhi, Weiming, et autres
Publié: (2025)
par: Zhi, Weiming, et autres
Publié: (2025)
DarkGS: Learning Neural Illumination and 3D Gaussians Relighting for Robotic Exploration in the Dark
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
Unifying Scene Representation and Hand-Eye Calibration with 3D Foundation Models
par: Zhi, Weiming, et autres
Publié: (2024)
par: Zhi, Weiming, et autres
Publié: (2024)
Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models
par: Cao, Jiahang, et autres
Publié: (2024)
par: Cao, Jiahang, et autres
Publié: (2024)
MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms
par: Shang, Tianyi, et autres
Publié: (2024)
par: Shang, Tianyi, et autres
Publié: (2024)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
par: Shi, Haoxiang, et autres
Publié: (2025)
par: Shi, Haoxiang, et autres
Publié: (2025)
AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond
par: Zhang, Haiming, et autres
Publié: (2026)
par: Zhang, Haiming, et autres
Publié: (2026)
HarvestFlex: Strawberry Harvesting via Vision-Language-Action Policy Adaptation in the Wild
par: Zhao, Ziyang, et autres
Publié: (2026)
par: Zhao, Ziyang, et autres
Publié: (2026)
Planning-Guided Diffusion Policy Learning for Generalizable Contact-Rich Bimanual Manipulation
par: Li, Xuanlin, et autres
Publié: (2024)
par: Li, Xuanlin, et autres
Publié: (2024)
H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
par: Lu, Yiyang, et autres
Publié: (2025)
par: Lu, Yiyang, et autres
Publié: (2025)
Action Images: End-to-End Policy Learning via Multiview Video Generation
par: Zhen, Haoyu, et autres
Publié: (2026)
par: Zhen, Haoyu, et autres
Publié: (2026)
Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion
par: Zhang, Lunjun, et autres
Publié: (2023)
par: Zhang, Lunjun, et autres
Publié: (2023)
Action Emergence from Streaming Intent
par: Jing, Pengfei, et autres
Publié: (2026)
par: Jing, Pengfei, et autres
Publié: (2026)
MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
par: Huang, Yuzhou, et autres
Publié: (2026)
par: Huang, Yuzhou, et autres
Publié: (2026)
CL3R: 3D Reconstruction and Contrastive Learning for Enhanced Robotic Manipulation Representations
par: Cui, Wenbo, et autres
Publié: (2025)
par: Cui, Wenbo, et autres
Publié: (2025)
PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators
par: Zeng, Kuo-Hao, et autres
Publié: (2024)
par: Zeng, Kuo-Hao, et autres
Publié: (2024)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
par: Shang, Tianyi, et autres
Publié: (2025)
par: Shang, Tianyi, et autres
Publié: (2025)
CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion
par: Ma, Jiahua, et autres
Publié: (2025)
par: Ma, Jiahua, et autres
Publié: (2025)
Modality-Composable Diffusion Policy via Inference-Time Distribution-level Composition
par: Cao, Jiahang, et autres
Publié: (2025)
par: Cao, Jiahang, et autres
Publié: (2025)
Point What You Mean: Visually Grounded Instruction Policy
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
par: Xiong, Yuwen, et autres
Publié: (2024)
par: Xiong, Yuwen, et autres
Publié: (2024)
M4Diffuser: Multi-View Diffusion Policy with Manipulability-Aware Control for Robust Mobile Manipulation
par: Dong, Ju, et autres
Publié: (2025)
par: Dong, Ju, et autres
Publié: (2025)
DVMNet++: Rethinking Relative Pose Estimation for Unseen Objects
par: Zhao, Chen, et autres
Publié: (2024)
par: Zhao, Chen, et autres
Publié: (2024)
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
par: Xu, Kechun, et autres
Publié: (2025)
par: Xu, Kechun, et autres
Publié: (2025)
Driving Intents Amplify Planning-Oriented Reinforcement Learning
par: Lu, Hengtong, et autres
Publié: (2026)
par: Lu, Hengtong, et autres
Publié: (2026)
DUViN: Diffusion-Based Underwater Visual Navigation via Knowledge-Transferred Depth Features
par: Yang, Jinghe, et autres
Publié: (2025)
par: Yang, Jinghe, et autres
Publié: (2025)
ARDuP: Active Region Video Diffusion for Universal Policies
par: Huang, Shuaiyi, et autres
Publié: (2024)
par: Huang, Shuaiyi, et autres
Publié: (2024)
GAMMA: Graspability-Aware Mobile MAnipulation Policy Learning based on Online Grasping Pose Fusion
par: Zhang, Jiazhao, et autres
Publié: (2023)
par: Zhang, Jiazhao, et autres
Publié: (2023)
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
par: Gao, Hao, et autres
Publié: (2025)
par: Gao, Hao, et autres
Publié: (2025)
Documents similaires
-
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025) -
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
par: Zhang, Tianyi, et autres
Publié: (2025) -
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
par: Luo, Gen, et autres
Publié: (2025) -
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
par: Shang, Shuyao, et autres
Publié: (2025) -
big.LITTLE Vision Transformer for Efficient Visual Recognition
par: Guo, He, et autres
Publié: (2024)