MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Liu, Yang, Ding, Pengxiang, Jiang, Tengyue, Wang, Xudong, Song, Wenxuan, Lin, Minghui, Zhao, Han, Zhang, Hongyin, Zhuang, Zifeng, Zhao, Wei, Huang, Siteng, Shi, Jinkui, Wang, Donglin
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!