$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Yijie, He, Jie, Shao, Rui, Yuan, Kaishen, Tan, Tao, Yuan, Xiaochen, Yu, Zitong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AU-TTT: Vision Test-Time Training model for Facial Action Unit Detection
par: Xing, Bohao, et autres
Publié: (2025)
par: Xing, Bohao, et autres
Publié: (2025)
AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion
par: Liu, Zhishu, et autres
Publié: (2025)
par: Liu, Zhishu, et autres
Publié: (2025)
AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit Detectors
par: Yuan, Kaishen, et autres
Publié: (2024)
par: Yuan, Kaishen, et autres
Publié: (2024)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)
par: Zhang, Wenyao, et autres
Publié: (2025)
SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
par: Ye, Qilang, et autres
Publié: (2025)
par: Ye, Qilang, et autres
Publié: (2025)
AULLM++: Structural Reasoning with Large Language Models for Micro-Expression Recognition
par: Liu, Zhishu, et autres
Publié: (2026)
par: Liu, Zhishu, et autres
Publié: (2026)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
par: Zhu, Yijie, et autres
Publié: (2025)
par: Zhu, Yijie, et autres
Publié: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026)
par: Liu, Chenyv, et autres
Publié: (2026)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
par: Sun, Jingwen, et autres
Publié: (2026)
par: Sun, Jingwen, et autres
Publié: (2026)
Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models
par: Zhang, Quan, et autres
Publié: (2024)
par: Zhang, Quan, et autres
Publié: (2024)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
par: Hu, Zhuozhao, et autres
Publié: (2025)
par: Hu, Zhuozhao, et autres
Publié: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
par: Xu, Siyu, et autres
Publié: (2025)
par: Xu, Siyu, et autres
Publié: (2025)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation
par: Yuan, Kaishen, et autres
Publié: (2025)
par: Yuan, Kaishen, et autres
Publié: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
par: Li, Hengtao, et autres
Publié: (2025)
par: Li, Hengtao, et autres
Publié: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
par: Du, Fan, et autres
Publié: (2026)
par: Du, Fan, et autres
Publié: (2026)
HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models
par: Yu, Le, et autres
Publié: (2025)
par: Yu, Le, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
par: Arai, Hidehisa, et autres
Publié: (2024)
par: Arai, Hidehisa, et autres
Publié: (2024)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation
par: Zhu, Yijie, et autres
Publié: (2025)
par: Zhu, Yijie, et autres
Publié: (2025)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
par: Dong, Shaoqi, et autres
Publié: (2025)
par: Dong, Shaoqi, et autres
Publié: (2025)
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
par: Zhou, Yuhao, et autres
Publié: (2026)
par: Zhou, Yuhao, et autres
Publié: (2026)
SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
par: Fang, Hengyu, et autres
Publié: (2025)
par: Fang, Hengyu, et autres
Publié: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
QuoVLA: Quotient Space for Vision-Language-Action Models
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)
par: Liu, Zeting, et autres
Publié: (2025)
Documents similaires
-
AU-TTT: Vision Test-Time Training model for Facial Action Unit Detection
par: Xing, Bohao, et autres
Publié: (2025) -
AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion
par: Liu, Zhishu, et autres
Publié: (2025) -
AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit Detectors
par: Yuan, Kaishen, et autres
Publié: (2024) -
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
par: Li, Wei, et autres
Publié: (2025) -
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)