AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Sixiang, Liu, Jiaming, Qian, Siyuan, Jiang, Han, Li, Lily, Zhang, Renrui, Liu, Zhuoyang, Gu, Chenyang, Hou, Chengkai, Wang, Pengwei, Wang, Zhongyuan, Zhang, Shanghang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024)
di: Jia, Yueru, et al.
Pubblicazione: (2024)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2026)
di: Chen, Hao, et al.
Pubblicazione: (2026)
Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2025)
di: Chen, Hao, et al.
Pubblicazione: (2025)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos
di: Li, Guangrun, et al.
Pubblicazione: (2025)
di: Li, Guangrun, et al.
Pubblicazione: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
U-DiT Policy: U-shaped Diffusion Transformers for Robotic Manipulation
di: Wu, Linzhi, et al.
Pubblicazione: (2025)
di: Wu, Linzhi, et al.
Pubblicazione: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
TaQ-DiT: Time-aware Quantization for Diffusion Transformers
di: Liu, Xinyan, et al.
Pubblicazione: (2024)
di: Liu, Xinyan, et al.
Pubblicazione: (2024)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations
di: Tan, Kailin, et al.
Pubblicazione: (2026)
di: Tan, Kailin, et al.
Pubblicazione: (2026)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
di: Deng, Juncan, et al.
Pubblicazione: (2024)
di: Deng, Juncan, et al.
Pubblicazione: (2024)
Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time Adaptation
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
di: Liu, Jiaming, et al.
Pubblicazione: (2023)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
di: Chen, Lei, et al.
Pubblicazione: (2024)
di: Chen, Lei, et al.
Pubblicazione: (2024)
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
di: Xu, Qinwen, et al.
Pubblicazione: (2026)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
di: Ma, Teli, et al.
Pubblicazione: (2026)
di: Ma, Teli, et al.
Pubblicazione: (2026)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
di: Liu, Dongyang, et al.
Pubblicazione: (2025)
di: Liu, Dongyang, et al.
Pubblicazione: (2025)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
di: Shi, Junqi, et al.
Pubblicazione: (2026)
di: Shi, Junqi, et al.
Pubblicazione: (2026)
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
di: Li, Zhimin, et al.
Pubblicazione: (2024)
di: Li, Zhimin, et al.
Pubblicazione: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
FD-DiT: Frequency Domain-Directed Diffusion Transformer for Low-Dose CT Reconstruction
di: Liu, Qiqing, et al.
Pubblicazione: (2025)
di: Liu, Qiqing, et al.
Pubblicazione: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
di: Tang, Yingbo, et al.
Pubblicazione: (2025)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
On Statistical Rates and Provably Efficient Criteria of Latent Diffusion Transformers (DiTs)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
di: Jia, Yueru, et al.
Pubblicazione: (2024) -
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
di: Liu, Jiaming, et al.
Pubblicazione: (2025) -
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2026) -
Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
di: Chen, Hao, et al.
Pubblicazione: (2025) -
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)