Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Won, John, Lee, Kyungmin, Jang, Huiwon, Kim, Dongyoung, Shin, Jinwoo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
par: Koo, Myungkyu, et autres
Publié: (2025)
par: Koo, Myungkyu, et autres
Publié: (2025)
RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning
par: Kim, Seungku, et autres
Publié: (2026)
par: Kim, Seungku, et autres
Publié: (2026)
Visual Representation Learning with Stochastic Frame Prediction
par: Jang, Huiwon, et autres
Publié: (2024)
par: Jang, Huiwon, et autres
Publié: (2024)
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
Adversarial Robustification via Text-to-Image Diffusion Models
par: Choi, Daewon, et autres
Publié: (2024)
par: Choi, Daewon, et autres
Publié: (2024)
Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
par: Lee, Jimin, et autres
Publié: (2026)
par: Lee, Jimin, et autres
Publié: (2026)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
par: Shi, Yiran, et autres
Publié: (2026)
par: Shi, Yiran, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
par: Sun, Jingwen, et autres
Publié: (2026)
par: Sun, Jingwen, et autres
Publié: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
Direct Consistency Optimization for Robust Customization of Text-to-Image Diffusion Models
par: Lee, Kyungmin, et autres
Publié: (2024)
par: Lee, Kyungmin, et autres
Publié: (2024)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
par: GigaBrain Team, et autres
Publié: (2025)
par: GigaBrain Team, et autres
Publié: (2025)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
par: Kim, Jisoo, et autres
Publié: (2026)
par: Kim, Jisoo, et autres
Publié: (2026)
Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
par: Lee, Kyungmin, et autres
Publié: (2025)
par: Lee, Kyungmin, et autres
Publié: (2025)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
par: Li, Runhao, et autres
Publié: (2025)
par: Li, Runhao, et autres
Publié: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)
par: Zhang, Wenyao, et autres
Publié: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
par: Liu, Jiaming, et autres
Publié: (2025)
par: Liu, Jiaming, et autres
Publié: (2025)
VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs
par: Jiang, Chaokang, et autres
Publié: (2026)
par: Jiang, Chaokang, et autres
Publié: (2026)
Improving Diffusion Models for Authentic Virtual Try-on in the Wild
par: Choi, Yisol, et autres
Publié: (2024)
par: Choi, Yisol, et autres
Publié: (2024)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
par: Wei, Meng, et autres
Publié: (2025)
par: Wei, Meng, et autres
Publié: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
par: Li, Zaijing, et autres
Publié: (2026)
par: Li, Zaijing, et autres
Publié: (2026)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
par: Yang, Yurou, et autres
Publié: (2026)
par: Yang, Yurou, et autres
Publié: (2026)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
par: Zhong, Zhide, et autres
Publié: (2026)
par: Zhong, Zhide, et autres
Publié: (2026)
World Action Models are Zero-shot Policies
par: Ye, Seonghyeon, et autres
Publié: (2026)
par: Ye, Seonghyeon, et autres
Publié: (2026)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)
par: Kim, Ju-Young, et autres
Publié: (2025)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
par: Englmeier, Stefan, et autres
Publié: (2026)
par: Englmeier, Stefan, et autres
Publié: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
eCAR: edge-assisted Collaborative Augmented Reality Framework
par: Jeon, Jinwoo, et autres
Publié: (2024)
par: Jeon, Jinwoo, et autres
Publié: (2024)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025)
par: Hou, Zhi, et autres
Publié: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
par: Lang, Xiaolei, et autres
Publié: (2026)
par: Lang, Xiaolei, et autres
Publié: (2026)
Documents similaires
-
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
par: Koo, Myungkyu, et autres
Publié: (2025) -
RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning
par: Kim, Seungku, et autres
Publié: (2026) -
Visual Representation Learning with Stochastic Frame Prediction
par: Jang, Huiwon, et autres
Publié: (2024) -
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
par: Jeon, Byungwoo, et autres
Publié: (2026) -
Adversarial Robustification via Text-to-Image Diffusion Models
par: Choi, Daewon, et autres
Publié: (2024)