Saved in:
| Main Authors: | Chen, Yiye, Jian, Yanan, Dong, Xiaoyi, Cao, Shuxin, Wu, Jing, Vela, Patricio, Lundell, Benjamin E., Chen, Dongdong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.05049 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Schema-Guided Scene-Graph Reasoning based on Multi-Agent Large Language Model System
by: Chen, Yiye, et al.
Published: (2025)
by: Chen, Yiye, et al.
Published: (2025)
Good Weights: Proactive, Adaptive Dead Reckoning Fusion for Continuous and Robust Visual SLAM
by: Du, Yanwei, et al.
Published: (2025)
by: Du, Yanwei, et al.
Published: (2025)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
by: Huang, Yanjia, et al.
Published: (2025)
by: Huang, Yanjia, et al.
Published: (2025)
Efficient Iterative Proximal Variational Inference Motion Planning
by: Chang, Zinuo, et al.
Published: (2024)
by: Chang, Zinuo, et al.
Published: (2024)
GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth
by: Jaganathan, Krishna, et al.
Published: (2026)
by: Jaganathan, Krishna, et al.
Published: (2026)
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
by: Zhang, Chaofan, et al.
Published: (2025)
by: Zhang, Chaofan, et al.
Published: (2025)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
by: Glossop, Catherine, et al.
Published: (2025)
by: Glossop, Catherine, et al.
Published: (2025)
QuadPiPS: A Perception-informed Footstep Planner for Quadrupeds With Semantic Affordance Prediction
by: Asselmeier, Max, et al.
Published: (2024)
by: Asselmeier, Max, et al.
Published: (2024)
Factor Graph-Based Shape Estimation for Continuum Robots via Magnus Expansion
by: Ticozzi, Lorenzo, et al.
Published: (2026)
by: Ticozzi, Lorenzo, et al.
Published: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
by: Wang, Zixuan, et al.
Published: (2026)
by: Wang, Zixuan, et al.
Published: (2026)
DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
by: Lin, Sixu, et al.
Published: (2026)
by: Lin, Sixu, et al.
Published: (2026)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
by: Bai, Shuanghao, et al.
Published: (2026)
by: Bai, Shuanghao, et al.
Published: (2026)
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
by: Shou, Quanxin, et al.
Published: (2026)
by: Shou, Quanxin, et al.
Published: (2026)
DDGC: Generative Deep Dexterous Grasping in Clutter
by: Lundell, Jens, et al.
Published: (2021)
by: Lundell, Jens, et al.
Published: (2021)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
by: Chen, Xiaoyu, et al.
Published: (2025)
by: Chen, Xiaoyu, et al.
Published: (2025)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
by: Hu, Yucheng, et al.
Published: (2026)
by: Hu, Yucheng, et al.
Published: (2026)
VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions
by: Chen, Guanyan, et al.
Published: (2024)
by: Chen, Guanyan, et al.
Published: (2024)
Point Tracking Improves World Action Models
by: Guan, Jiarui, et al.
Published: (2026)
by: Guan, Jiarui, et al.
Published: (2026)
Task-driven SLAM Benchmarking For Robot Navigation
by: Du, Yanwei, et al.
Published: (2024)
by: Du, Yanwei, et al.
Published: (2024)
A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving
by: Zhang, Liangdong, et al.
Published: (2026)
by: Zhang, Liangdong, et al.
Published: (2026)
Pushing Everything Everywhere All At Once: Probabilistic Prehensile Pushing
by: Perugini, Patrizio, et al.
Published: (2025)
by: Perugini, Patrizio, et al.
Published: (2025)
CAPGrasp: An $\mathbb{R}^3\times \text{SO(2)-equivariant}$ Continuous Approach-Constrained Generative Grasp Sampler
by: Weng, Zehang, et al.
Published: (2023)
by: Weng, Zehang, et al.
Published: (2023)
Preference-Conditioned Multi-Objective RL for Integrated Command Tracking and Force Compliance in Humanoid Locomotion
by: Leng, Tingxuan, et al.
Published: (2025)
by: Leng, Tingxuan, et al.
Published: (2025)
OmniPose6D: Towards Short-Term Object Pose Tracking in Dynamic Scenes from Monocular RGB
by: Lin, Yunzhi, et al.
Published: (2024)
by: Lin, Yunzhi, et al.
Published: (2024)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
by: Deng, Shengliang, et al.
Published: (2025)
by: Deng, Shengliang, et al.
Published: (2025)
Safe Gap-based Planning in Dynamic Settings
by: Asselmeier, Max, et al.
Published: (2025)
by: Asselmeier, Max, et al.
Published: (2025)
Hierarchical Experience-informed Navigation for Multi-modal Quadrupedal Rebar Grid Traversal
by: Asselmeier, Max, et al.
Published: (2023)
by: Asselmeier, Max, et al.
Published: (2023)
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
by: Li, Xiaoqi, et al.
Published: (2026)
by: Li, Xiaoqi, et al.
Published: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
by: Zhong, Zhide, et al.
Published: (2025)
by: Zhong, Zhide, et al.
Published: (2025)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
by: Zhong, Yifan, et al.
Published: (2025)
by: Zhong, Yifan, et al.
Published: (2025)
MMDVS-LF: Multi-Modal Dynamic Vision Sensor and Eye-Tracking Dataset for Line Following
by: Resch, Felix, et al.
Published: (2024)
by: Resch, Felix, et al.
Published: (2024)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
by: Nie, Dujun, et al.
Published: (2026)
by: Nie, Dujun, et al.
Published: (2026)
Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models
by: Soedarmadji, Saraswati, et al.
Published: (2025)
by: Soedarmadji, Saraswati, et al.
Published: (2025)
Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control
by: Arslan, Hüseyin, et al.
Published: (2026)
by: Arslan, Hüseyin, et al.
Published: (2026)
Human-assisted Robotic Policy Refinement via Action Preference Optimization
by: Xia, Wenke, et al.
Published: (2025)
by: Xia, Wenke, et al.
Published: (2025)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
by: Zhang, Qiyao, et al.
Published: (2026)
by: Zhang, Qiyao, et al.
Published: (2026)
FLoRA: Sample-Efficient Preference-based RL via Low-Rank Style Adaptation of Reward Functions
by: Marta, Daniel, et al.
Published: (2025)
by: Marta, Daniel, et al.
Published: (2025)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
by: Zhang, Yichi, et al.
Published: (2026)
by: Zhang, Yichi, et al.
Published: (2026)
LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
by: Ding, Hongyu, et al.
Published: (2025)
by: Ding, Hongyu, et al.
Published: (2025)
Similar Items
-
Schema-Guided Scene-Graph Reasoning based on Multi-Agent Large Language Model System
by: Chen, Yiye, et al.
Published: (2025) -
Good Weights: Proactive, Adaptive Dead Reckoning Fusion for Continuous and Robust Visual SLAM
by: Du, Yanwei, et al.
Published: (2025) -
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
by: Huang, Yanjia, et al.
Published: (2025) -
Efficient Iterative Proximal Variational Inference Motion Planning
by: Chang, Zinuo, et al.
Published: (2024) -
GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth
by: Jaganathan, Krishna, et al.
Published: (2026)