Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yurou, Lin, Muyuan, Martin-Martin, Roberto, Labrie, Martin, Gayaka, Shreekant, Kuo, Cheng-Hao, Carlone, Luca |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Configurable Embodied Data Generation for Class-Agnostic RGB-D Video Segmentation
por: Opipari, Anthony, et al.
Publicado: (2024)
por: Opipari, Anthony, et al.
Publicado: (2024)
UA-Pose: Uncertainty-Aware 6D Object Pose Estimation and Online Object Completion with Partial References
por: Li, Ming-Feng, et al.
Publicado: (2025)
por: Li, Ming-Feng, et al.
Publicado: (2025)
LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation
por: Guan, Tianrui, et al.
Publicado: (2024)
por: Guan, Tianrui, et al.
Publicado: (2024)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
por: Lv, Qi, et al.
Publicado: (2025)
por: Lv, Qi, et al.
Publicado: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
por: Lin, Tao, et al.
Publicado: (2025)
por: Lin, Tao, et al.
Publicado: (2025)
VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction
por: Maggio, Dominic, et al.
Publicado: (2026)
por: Maggio, Dominic, et al.
Publicado: (2026)
CUPS: Improving Human Pose-Shape Estimators with Conformalized Deep Uncertainty
por: Zhang, Harry, et al.
Publicado: (2024)
por: Zhang, Harry, et al.
Publicado: (2024)
POp-GS: Next Best View in 3D-Gaussian Splatting with P-Optimality
por: Wilson, Joey, et al.
Publicado: (2025)
por: Wilson, Joey, et al.
Publicado: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
por: Liang, Wenqi, et al.
Publicado: (2025)
por: Liang, Wenqi, et al.
Publicado: (2025)
Pandora: Articulated 3D Scene Graphs from Egocentric Vision
por: Yu, Alan, et al.
Publicado: (2026)
por: Yu, Alan, et al.
Publicado: (2026)
Multi-Model 3D Registration: Finding Multiple Moving Objects in Cluttered Point Clouds
por: Jin, David, et al.
Publicado: (2024)
por: Jin, David, et al.
Publicado: (2024)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
por: Yang, Shuai, et al.
Publicado: (2025)
por: Yang, Shuai, et al.
Publicado: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
por: Wang, Yating, et al.
Publicado: (2025)
por: Wang, Yating, et al.
Publicado: (2025)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
por: Lin, Yihan, et al.
Publicado: (2026)
por: Lin, Yihan, et al.
Publicado: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
por: Zhang, Zhengshen, et al.
Publicado: (2025)
por: Zhang, Zhengshen, et al.
Publicado: (2025)
Uncertainty Quantification for Visual Object Pose Estimation
por: Shaikewitz, Lorenzo, et al.
Publicado: (2025)
por: Shaikewitz, Lorenzo, et al.
Publicado: (2025)
Category-Level Object Shape and Pose Estimation in Less Than a Millisecond
por: Shaikewitz, Lorenzo, et al.
Publicado: (2025)
por: Shaikewitz, Lorenzo, et al.
Publicado: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
por: Tong, Baoshun, et al.
Publicado: (2026)
por: Tong, Baoshun, et al.
Publicado: (2026)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
por: Shi, Hao, et al.
Publicado: (2025)
por: Shi, Hao, et al.
Publicado: (2025)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
por: Zhou, Jiaying, et al.
Publicado: (2026)
por: Zhou, Jiaying, et al.
Publicado: (2026)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
por: Liu, Yicheng, et al.
Publicado: (2025)
por: Liu, Yicheng, et al.
Publicado: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
por: Zhao, Chen, et al.
Publicado: (2026)
por: Zhao, Chen, et al.
Publicado: (2026)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
por: Xia, Zhongyu, et al.
Publicado: (2026)
por: Xia, Zhongyu, et al.
Publicado: (2026)
ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance
por: Li, Zhuohao, et al.
Publicado: (2026)
por: Li, Zhuohao, et al.
Publicado: (2026)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
por: Lin, Tao, et al.
Publicado: (2026)
por: Lin, Tao, et al.
Publicado: (2026)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
Robot Manipulation in Salient Vision through Referring Image Segmentation and Geometric Constraints
por: Jiang, Chen, et al.
Publicado: (2024)
por: Jiang, Chen, et al.
Publicado: (2024)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
por: Xu, Yuhao, et al.
Publicado: (2026)
por: Xu, Yuhao, et al.
Publicado: (2026)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
por: Ye, Wencheng, et al.
Publicado: (2025)
por: Ye, Wencheng, et al.
Publicado: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026)
por: Tang, Zuojin, et al.
Publicado: (2026)
PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model
por: Liu, Shang-Ching, et al.
Publicado: (2024)
por: Liu, Shang-Ching, et al.
Publicado: (2024)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
por: Yang, Jiabing, et al.
Publicado: (2026)
por: Yang, Jiabing, et al.
Publicado: (2026)
Tactile Modality Fusion for Vision-Language-Action Models
por: Morissette, Charlotte, et al.
Publicado: (2026)
por: Morissette, Charlotte, et al.
Publicado: (2026)
Ejemplares similares
-
Configurable Embodied Data Generation for Class-Agnostic RGB-D Video Segmentation
por: Opipari, Anthony, et al.
Publicado: (2024) -
UA-Pose: Uncertainty-Aware 6D Object Pose Estimation and Online Object Completion with Partial References
por: Li, Ming-Feng, et al.
Publicado: (2025) -
LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation
por: Guan, Tianrui, et al.
Publicado: (2024) -
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
por: Lv, Qi, et al.
Publicado: (2025) -
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
por: Lin, Tao, et al.
Publicado: (2025)