DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Wanpeng, Wang, Ye, Luo, Hao, Yuan, Haoqi, Feng, Yicheng, Zheng, Sipeng, Jin, Qin, Lu, Zongqing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
par: Feng, Yicheng, et autres
Publié: (2025)
par: Feng, Yicheng, et autres
Publié: (2025)
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
par: Luo, Hao, et autres
Publié: (2026)
par: Luo, Hao, et autres
Publié: (2026)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
par: Zhang, Wanpeng, et autres
Publié: (2026)
par: Zhang, Wanpeng, et autres
Publié: (2026)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
par: Luo, Hao, et autres
Publié: (2025)
par: Luo, Hao, et autres
Publié: (2025)
Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
par: Xu, Haiweng, et autres
Publié: (2026)
par: Xu, Haiweng, et autres
Publié: (2026)
Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization
par: Luo, Hao, et autres
Publié: (2026)
par: Luo, Hao, et autres
Publié: (2026)
PhysiFlow: Physics-Aware Humanoid Whole-Body VLA via Multi-Brain Latent Flow Matching and Robust Tracking
par: Qin, Weikai, et autres
Publié: (2026)
par: Qin, Weikai, et autres
Publié: (2026)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
par: Luo, Hao, et autres
Publié: (2026)
par: Luo, Hao, et autres
Publié: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
par: Li, Boyu, et autres
Publié: (2026)
par: Li, Boyu, et autres
Publié: (2026)
Efficient Residual Learning with Mixture-of-Experts for Universal Dexterous Grasping
par: Huang, Ziye, et autres
Publié: (2024)
par: Huang, Ziye, et autres
Publié: (2024)
Learning Diverse Bimanual Dexterous Manipulation Skills from Human Demonstrations
par: Zhou, Bohan, et autres
Publié: (2024)
par: Zhou, Bohan, et autres
Publié: (2024)
Cross-Embodiment Dexterous Grasping with Reinforcement Learning
par: Yuan, Haoqi, et autres
Publié: (2024)
par: Yuan, Haoqi, et autres
Publié: (2024)
VideoOrion: Tokenizing Object Dynamics in Videos
par: Feng, Yicheng, et autres
Publié: (2024)
par: Feng, Yicheng, et autres
Publié: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
DemoGrasp: Universal Dexterous Grasping from a Single Demonstration
par: Yuan, Haoqi, et autres
Publié: (2025)
par: Yuan, Haoqi, et autres
Publié: (2025)
UniTacHand: Unified Spatio-Tactile Representation for Human to Robotic Hand Skill Transfer
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills
par: Yuan, Haoqi, et autres
Publié: (2025)
par: Yuan, Haoqi, et autres
Publié: (2025)
QuadrupedGPT: Towards a Versatile Quadruped Agent in Open-ended Worlds
par: Mei, Yuting, et autres
Publié: (2024)
par: Mei, Yuting, et autres
Publié: (2024)
DiG-Net: Enhancing Human-Robot Interaction through Hyper-Range Dynamic Gesture Recognition in Assistive Robotics
par: Beeri, Eran Bamani, et autres
Publié: (2025)
par: Beeri, Eran Bamani, et autres
Publié: (2025)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning
par: Mao, Chuan, et autres
Publié: (2025)
par: Mao, Chuan, et autres
Publié: (2025)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
par: Zheng, Sipeng, et autres
Publié: (2024)
par: Zheng, Sipeng, et autres
Publié: (2024)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
par: Pan, Xu, et autres
Publié: (2026)
par: Pan, Xu, et autres
Publié: (2026)
Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control
par: Zhang, Zunzhe, et autres
Publié: (2026)
par: Zhang, Zunzhe, et autres
Publié: (2026)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
par: Zhang, Wanpeng, et autres
Publié: (2024)
par: Zhang, Wanpeng, et autres
Publié: (2024)
SPAFormer: Sequential 3D Part Assembly with Transformers
par: Xu, Boshen, et autres
Publié: (2024)
par: Xu, Boshen, et autres
Publié: (2024)
DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation
par: Fu, Yuhui, et autres
Publié: (2025)
par: Fu, Yuhui, et autres
Publié: (2025)
Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
par: Shi, Yiran, et autres
Publié: (2026)
par: Shi, Yiran, et autres
Publié: (2026)
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models
par: Soleymanzadeh, Davood, et autres
Publié: (2026)
par: Soleymanzadeh, Davood, et autres
Publié: (2026)
ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching
par: Zhang, Shuoheng, et autres
Publié: (2026)
par: Zhang, Shuoheng, et autres
Publié: (2026)
Galaxea Open-World Dataset and G0 Dual-System VLA Model
par: Jiang, Tao, et autres
Publié: (2025)
par: Jiang, Tao, et autres
Publié: (2025)
Efficient Trajectory Forecasting and Generation with Conditional Flow Matching
par: Ye, Sean, et autres
Publié: (2024)
par: Ye, Sean, et autres
Publié: (2024)
DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
par: Chen, Jiayi, et autres
Publié: (2026)
par: Chen, Jiayi, et autres
Publié: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
par: Zhong, Zhide, et autres
Publié: (2025)
par: Zhong, Zhide, et autres
Publié: (2025)
Trajectory-Consistent Flow Matching for Robust Visuomotor Policy Learning
par: Ahmed, Riad, et autres
Publié: (2026)
par: Ahmed, Riad, et autres
Publié: (2026)
ChainFlow-VLA: Causal Flow Planning with Vision-Language Models
par: Wang, Xiyang, et autres
Publié: (2026)
par: Wang, Xiyang, et autres
Publié: (2026)
Documents similaires
-
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
par: Feng, Yicheng, et autres
Publié: (2025) -
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
par: Luo, Hao, et autres
Publié: (2026) -
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
par: Zhang, Wanpeng, et autres
Publié: (2026) -
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
par: Luo, Hao, et autres
Publié: (2025) -
Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
par: Wang, Ye, et autres
Publié: (2026)