DNAct: Diffusion Guided Multi-Task 3D Policy Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Ge, Wu, Yueh-Hua, Wang, Xiaolong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
Humanoid Policy ~ Human Policy
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2025)
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2025)
GNFactor: Multi-Task Real Robot Learning with Generalizable Neural Feature Fields
di: Ze, Yanjie, et al.
Pubblicazione: (2023)
di: Ze, Yanjie, et al.
Pubblicazione: (2023)
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
di: Ma, Xiao, et al.
Pubblicazione: (2024)
di: Ma, Xiao, et al.
Pubblicazione: (2024)
Gaze-Guided 3D Hand Motion Prediction for Detecting Intent in Egocentric Grasping Tasks
di: He, Yufei, et al.
Pubblicazione: (2025)
di: He, Yufei, et al.
Pubblicazione: (2025)
On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
di: Wu, Yiming, et al.
Pubblicazione: (2025)
di: Wu, Yiming, et al.
Pubblicazione: (2025)
Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning
di: Liu, Yijun, et al.
Pubblicazione: (2025)
di: Liu, Yijun, et al.
Pubblicazione: (2025)
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
di: Wu, Pengyuan, et al.
Pubblicazione: (2026)
di: Wu, Pengyuan, et al.
Pubblicazione: (2026)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
di: Chen, Xiao, et al.
Pubblicazione: (2025)
di: Chen, Xiao, et al.
Pubblicazione: (2025)
M4Diffuser: Multi-View Diffusion Policy with Manipulability-Aware Control for Robust Mobile Manipulation
di: Dong, Ju, et al.
Pubblicazione: (2025)
di: Dong, Ju, et al.
Pubblicazione: (2025)
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
di: Tian, Jingyi, et al.
Pubblicazione: (2025)
di: Tian, Jingyi, et al.
Pubblicazione: (2025)
Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions
di: Wu, Ruihai, et al.
Pubblicazione: (2023)
di: Wu, Ruihai, et al.
Pubblicazione: (2023)
PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes
di: Abdelreheem, Ahmed, et al.
Pubblicazione: (2025)
di: Abdelreheem, Ahmed, et al.
Pubblicazione: (2025)
X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations
di: Pace, Maximus A., et al.
Pubblicazione: (2025)
di: Pace, Maximus A., et al.
Pubblicazione: (2025)
GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction
di: Chen, Xiao, et al.
Pubblicazione: (2024)
di: Chen, Xiao, et al.
Pubblicazione: (2024)
EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction
di: Yang, Yiru, et al.
Pubblicazione: (2026)
di: Yang, Yiru, et al.
Pubblicazione: (2026)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
Part-Guided 3D RL for Sim2Real Articulated Object Manipulation
di: Xie, Pengwei, et al.
Pubblicazione: (2024)
di: Xie, Pengwei, et al.
Pubblicazione: (2024)
HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos
di: Banerjee, Prithviraj, et al.
Pubblicazione: (2024)
di: Banerjee, Prithviraj, et al.
Pubblicazione: (2024)
MapDream: Task-Driven Map Learning for Vision-Language Navigation
di: Lian, Guoxin, et al.
Pubblicazione: (2026)
di: Lian, Guoxin, et al.
Pubblicazione: (2026)
ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs
di: Wu, Xin, et al.
Pubblicazione: (2026)
di: Wu, Xin, et al.
Pubblicazione: (2026)
Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion
di: Lu, Haoran, et al.
Pubblicazione: (2026)
di: Lu, Haoran, et al.
Pubblicazione: (2026)
GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMs
di: Xu, Xinli, et al.
Pubblicazione: (2024)
di: Xu, Xinli, et al.
Pubblicazione: (2024)
Multi-modal Situated Reasoning in 3D Scenes
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
di: Feng, ZhiYuan, et al.
Pubblicazione: (2026)
di: Feng, ZhiYuan, et al.
Pubblicazione: (2026)
RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation
di: Chang, Yue, et al.
Pubblicazione: (2026)
di: Chang, Yue, et al.
Pubblicazione: (2026)
MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
di: Chen, Guangli, et al.
Pubblicazione: (2026)
di: Chen, Guangli, et al.
Pubblicazione: (2026)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
CL3R: 3D Reconstruction and Contrastive Learning for Enhanced Robotic Manipulation Representations
di: Cui, Wenbo, et al.
Pubblicazione: (2025)
di: Cui, Wenbo, et al.
Pubblicazione: (2025)
FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects
di: Eisner, Ben, et al.
Pubblicazione: (2022)
di: Eisner, Ben, et al.
Pubblicazione: (2022)
Toward General Object-level Mapping from Sparse Views with 3D Diffusion Priors
di: Liao, Ziwei, et al.
Pubblicazione: (2024)
di: Liao, Ziwei, et al.
Pubblicazione: (2024)
Autonomous Vision-Guided Resection of Central Airway Obstruction
di: Smith, M. E., et al.
Pubblicazione: (2025)
di: Smith, M. E., et al.
Pubblicazione: (2025)
MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks
di: Che, Lirong, et al.
Pubblicazione: (2026)
di: Che, Lirong, et al.
Pubblicazione: (2026)
Efficient Robotic Policy Learning via Latent Space Backward Planning
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
di: Yang, Yue, et al.
Pubblicazione: (2023)
di: Yang, Yue, et al.
Pubblicazione: (2023)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
di: Lu, Yiyang, et al.
Pubblicazione: (2025) -
Humanoid Policy ~ Human Policy
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2025) -
GNFactor: Multi-Task Real Robot Learning with Generalizable Neural Feature Fields
di: Ze, Yanjie, et al.
Pubblicazione: (2023) -
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
di: Ma, Xiao, et al.
Pubblicazione: (2024) -
Gaze-Guided 3D Hand Motion Prediction for Detecting Intent in Egocentric Grasping Tasks
di: He, Yufei, et al.
Pubblicazione: (2025)