Enregistré dans:
| Auteurs principaux: | Zhao, Ziyang, Wang, Shuheng, Miao, Zhonghua, Xiong, Ya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.05982 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
par: Zhang, Siqi, et autres
Publié: (2025)
par: Zhang, Siqi, et autres
Publié: (2025)
Online Estimation of Table-Top Grown Strawberry Mass in Field Conditions with Occlusions
par: Zhen, Jinshan, et autres
Publié: (2025)
par: Zhen, Jinshan, et autres
Publié: (2025)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025)
par: Hou, Zhi, et autres
Publié: (2025)
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
par: Xu, Kechun, et autres
Publié: (2025)
par: Xu, Kechun, et autres
Publié: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
par: Song, Wenxuan, et autres
Publié: (2026)
par: Song, Wenxuan, et autres
Publié: (2026)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
par: Zhang, Tianyi, et autres
Publié: (2025)
par: Zhang, Tianyi, et autres
Publié: (2025)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
Robotic Grasping of Harvested Tomato Trusses Using Vision and Online Learning
par: Bent, Luuk van den, et autres
Publié: (2023)
par: Bent, Luuk van den, et autres
Publié: (2023)
A Fast Path-Planning Method for Continuous Harvesting of Table-Top Grown Strawberries
par: Miao, Zhonghua, et autres
Publié: (2025)
par: Miao, Zhonghua, et autres
Publié: (2025)
VITA: Vision-to-Action Flow Matching Policy
par: Gao, Dechen, et autres
Publié: (2025)
par: Gao, Dechen, et autres
Publié: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
An RGB-D Image Dataset for Lychee Detection and Maturity Classification for Robotic Harvesting
par: Zhang, Zhenpeng, et autres
Publié: (2025)
par: Zhang, Zhenpeng, et autres
Publié: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
par: Koo, Myungkyu, et autres
Publié: (2025)
par: Koo, Myungkyu, et autres
Publié: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
From Seedling to Harvest: The GrowingSoy Dataset for Weed Detection in Soy Crops via Instance Segmentation
par: Steinmetz, Raul, et autres
Publié: (2024)
par: Steinmetz, Raul, et autres
Publié: (2024)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow as Latent Motion Prior
par: Wang, Xinkai, et autres
Publié: (2026)
par: Wang, Xinkai, et autres
Publié: (2026)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
par: Lin, Haitao, et autres
Publié: (2026)
par: Lin, Haitao, et autres
Publié: (2026)
Multi-vision-based Picking Point Localisation of Target Fruit for Harvesting Robots
par: Beldek, C., et autres
Publié: (2025)
par: Beldek, C., et autres
Publié: (2025)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
par: Fu, Haoyu, et autres
Publié: (2025)
par: Fu, Haoyu, et autres
Publié: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
par: Shi, Yiran, et autres
Publié: (2026)
par: Shi, Yiran, et autres
Publié: (2026)
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
par: Li, Haosheng, et autres
Publié: (2026)
par: Li, Haosheng, et autres
Publié: (2026)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
par: Fu, Yankai, et autres
Publié: (2025)
par: Fu, Yankai, et autres
Publié: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
par: Liang, Zhixuan, et autres
Publié: (2025)
par: Liang, Zhixuan, et autres
Publié: (2025)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
par: Lin, Yihan, et autres
Publié: (2026)
par: Lin, Yihan, et autres
Publié: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
par: Govind, Manish Kumar, et autres
Publié: (2026)
par: Govind, Manish Kumar, et autres
Publié: (2026)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
Documents similaires
-
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
par: Zhang, Siqi, et autres
Publié: (2025) -
Online Estimation of Table-Top Grown Strawberry Mass in Field Conditions with Occlusions
par: Zhen, Jinshan, et autres
Publié: (2025) -
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025) -
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
par: Xu, Kechun, et autres
Publié: (2025) -
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)