Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
Fuente:
arXiv
Guardado en:
| Autores principales: | Hou, Zhi, Zhang, Tianyi, Xiong, Yuwen, Duan, Haonan, Pu, Hengjun, Tong, Ronglei, Zhao, Chengyang, Zhu, Xizhou, Qiao, Yu, Dai, Jifeng, Chen, Yuntao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion Transformer Policy
por: Hou, Zhi, et al.
Publicado: (2024)
por: Hou, Zhi, et al.
Publicado: (2024)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
por: Xiong, Yuwen, et al.
Publicado: (2024)
por: Xiong, Yuwen, et al.
Publicado: (2024)
big.LITTLE Vision Transformer for Efficient Visual Recognition
por: Guo, He, et al.
Publicado: (2024)
por: Guo, He, et al.
Publicado: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)
por: Wu, Jiannan, et al.
Publicado: (2024)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
por: Duan, Yuchen, et al.
Publicado: (2024)
por: Duan, Yuchen, et al.
Publicado: (2024)
CSU-PCAST: A Dual-Branch Transformer Framework for medium-range ensemble Precipitation Forecasting
por: Xiong, Tianyi, et al.
Publicado: (2025)
por: Xiong, Tianyi, et al.
Publicado: (2025)
FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
por: Reuss, Moritz, et al.
Publicado: (2025)
por: Reuss, Moritz, et al.
Publicado: (2025)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023)
por: Chen, Zhe, et al.
Publicado: (2023)
CoMemo: LVLMs Need Image Context with Image Memory
por: Liu, Shi, et al.
Publicado: (2025)
por: Liu, Shi, et al.
Publicado: (2025)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
por: Yang, Ganlin, et al.
Publicado: (2025)
por: Yang, Ganlin, et al.
Publicado: (2025)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
por: Ge, Junqi, et al.
Publicado: (2024)
por: Ge, Junqi, et al.
Publicado: (2024)
Demystifying Diffusion Policies: Action Memorization and Simple Lookup Table Alternatives
por: He, Chengyang, et al.
Publicado: (2025)
por: He, Chengyang, et al.
Publicado: (2025)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
por: Tao, Chenxin, et al.
Publicado: (2024)
por: Tao, Chenxin, et al.
Publicado: (2024)
Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
Learning A Low-Level Vision Generalist via Visual Task Prompt
por: Chen, Xiangyu, et al.
Publicado: (2024)
por: Chen, Xiangyu, et al.
Publicado: (2024)
HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
por: Du, Zhiying, et al.
Publicado: (2025)
por: Du, Zhiying, et al.
Publicado: (2025)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
por: Chen, Xinyi, et al.
Publicado: (2025)
por: Chen, Xinyi, et al.
Publicado: (2025)
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
por: Wu, Zhiyong, et al.
Publicado: (2024)
por: Wu, Zhiyong, et al.
Publicado: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
Data and code used for paper entitled "The Bear Attack as a Warning: From Clouded Skies to Collapsing Ecosystems"
por: Xiao, Hengjun
Publicado: (2026)
por: Xiao, Hengjun
Publicado: (2026)
LangBridge: Interpreting Image as a Combination of Language Embeddings
por: Liao, Jiaqi, et al.
Publicado: (2025)
por: Liao, Jiaqi, et al.
Publicado: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
por: Hu, Xiaowei, et al.
Publicado: (2022)
por: Hu, Xiaowei, et al.
Publicado: (2022)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
DGSolver: Diffusion Generalist Solver with Universal Posterior Sampling for Image Restoration
por: Wang, Hebaixu, et al.
Publicado: (2025)
por: Wang, Hebaixu, et al.
Publicado: (2025)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
What Matters in Building Vision-Language-Action Models for Generalist Robots
por: Li, Xinghang, et al.
Publicado: (2024)
por: Li, Xinghang, et al.
Publicado: (2024)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
por: Apanasevich, I., et al.
Publicado: (2026)
por: Apanasevich, I., et al.
Publicado: (2026)
SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones
por: Adang, Maximilian, et al.
Publicado: (2025)
por: Adang, Maximilian, et al.
Publicado: (2025)
Turning Video Models into Generalist Robot Policies
por: Li, Sizhe Lester, et al.
Publicado: (2026)
por: Li, Sizhe Lester, et al.
Publicado: (2026)
Parameter-Inverted Image Pyramid Networks
por: Zhu, Xizhou, et al.
Publicado: (2024)
por: Zhu, Xizhou, et al.
Publicado: (2024)
Scaling Generalist Data-Analytic Agents
por: Qiao, Shuofei, et al.
Publicado: (2025)
por: Qiao, Shuofei, et al.
Publicado: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
por: Liang, Zhixuan, et al.
Publicado: (2025)
por: Liang, Zhixuan, et al.
Publicado: (2025)
Effective Tuning Strategies for Generalist Robot Manipulation Policies
por: Zhang, Wenbo, et al.
Publicado: (2024)
por: Zhang, Wenbo, et al.
Publicado: (2024)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
por: Dai, Yuntao, et al.
Publicado: (2025)
por: Dai, Yuntao, et al.
Publicado: (2025)
Toward a Diffusion-Based Generalist for Dense Vision Tasks
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
A New Multi-Picture Architecture for Learned Video Deinterlacing and Demosaicing with Parallel Deformable Convolution and Self-Attention Blocks
por: Ji, Ronglei, et al.
Publicado: (2024)
por: Ji, Ronglei, et al.
Publicado: (2024)
Multi-Field De-interlacing using Deformable Convolution Residual Blocks and Self-Attention
por: Ji, Ronglei, et al.
Publicado: (2022)
por: Ji, Ronglei, et al.
Publicado: (2022)
Ejemplares similares
-
Diffusion Transformer Policy
por: Hou, Zhi, et al.
Publicado: (2024) -
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
por: Zhang, Tianyi, et al.
Publicado: (2025) -
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
por: Xiong, Yuwen, et al.
Publicado: (2024) -
big.LITTLE Vision Transformer for Efficient Visual Recognition
por: Guo, He, et al.
Publicado: (2024) -
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)