InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ji, Wu, Shihan, Luo, Xu, Wu, Hao, Gao, Lianli, Shen, Heng Tao, Song, Jingkuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Contrastive Decoding for Robotic Foundation Models
par: Wu, Shihan, et autres
Publié: (2025)
par: Wu, Shihan, et autres
Publié: (2025)
Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation
par: Zhu, Junhong, et autres
Publié: (2026)
par: Zhu, Junhong, et autres
Publié: (2026)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
A Closer Look at Conditional Prompt Tuning for Vision-Language Models
par: Zhang, Ji, et autres
Publié: (2025)
par: Zhang, Ji, et autres
Publié: (2025)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
DePT: Decoupled Prompt Tuning
par: Zhang, Ji, et autres
Publié: (2023)
par: Zhang, Ji, et autres
Publié: (2023)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
par: Yin, Zhenhan, et autres
Publié: (2025)
par: Yin, Zhenhan, et autres
Publié: (2025)
Language-Grounded Decoupled Action Representation for Robotic Manipulation
par: Weng, Wuding, et autres
Publié: (2026)
par: Weng, Wuding, et autres
Publié: (2026)
Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation
par: Fang, Kaipeng, et autres
Publié: (2026)
par: Fang, Kaipeng, et autres
Publié: (2026)
Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation
par: Xing, Youguang, et autres
Publié: (2025)
par: Xing, Youguang, et autres
Publié: (2025)
Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols
par: Luo, Xu, et autres
Publié: (2026)
par: Luo, Xu, et autres
Publié: (2026)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
par: Xu, Haiweng, et autres
Publié: (2026)
par: Xu, Haiweng, et autres
Publié: (2026)
Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization
par: Lyu, Xinyu, et autres
Publié: (2024)
par: Lyu, Xinyu, et autres
Publié: (2024)
AICL: Action In-Context Learning for Video Diffusion Model
par: Liu, Jianzhi, et autres
Publié: (2024)
par: Liu, Jianzhi, et autres
Publié: (2024)
DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models
par: Xu, Siyuan, et autres
Publié: (2026)
par: Xu, Siyuan, et autres
Publié: (2026)
TIMI: Training-Free Image-to-3D Multi-Instance Generation with Spatial Fidelity
par: Cai, Xiao, et autres
Publié: (2026)
par: Cai, Xiao, et autres
Publié: (2026)
Reliable Few-shot Learning under Dual Noises
par: Zhang, Ji, et autres
Publié: (2025)
par: Zhang, Ji, et autres
Publié: (2025)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
par: Li, Xiaoqi, et autres
Publié: (2025)
par: Li, Xiaoqi, et autres
Publié: (2025)
Unlocking Smarter Device Control: Foresighted Planning with a World Model-Driven Code Execution Approach
par: Yin, Xiaoran, et autres
Publié: (2025)
par: Yin, Xiaoran, et autres
Publié: (2025)
RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
par: Koo, Jiyeon, et autres
Publié: (2025)
par: Koo, Jiyeon, et autres
Publié: (2025)
Continuous Reasoning for Vision-Language-Action
par: Wu, Yueh-Hua, et autres
Publié: (2026)
par: Wu, Yueh-Hua, et autres
Publié: (2026)
MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning
par: Huang, Wenhui, et autres
Publié: (2025)
par: Huang, Wenhui, et autres
Publié: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026)
par: Jie, Haoxiang, et autres
Publié: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
CFReID: Continual Few-shot Person Re-Identification
par: Ni, Hao, et autres
Publié: (2025)
par: Ni, Hao, et autres
Publié: (2025)
Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
par: Li, Pengteng, et autres
Publié: (2026)
par: Li, Pengteng, et autres
Publié: (2026)
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
par: Shou, Quanxin, et autres
Publié: (2026)
par: Shou, Quanxin, et autres
Publié: (2026)
VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
par: Li, Ye, et autres
Publié: (2026)
par: Li, Ye, et autres
Publié: (2026)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
par: Tu, Ruisen, et autres
Publié: (2026)
par: Tu, Ruisen, et autres
Publié: (2026)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
par: Zhu, Juan, et autres
Publié: (2026)
par: Zhu, Juan, et autres
Publié: (2026)
Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
par: Hu, Tianshuai, et autres
Publié: (2025)
par: Hu, Tianshuai, et autres
Publié: (2025)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
par: Lin, Fanqi, et autres
Publié: (2025)
par: Lin, Fanqi, et autres
Publié: (2025)
TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
par: Zhang, Zongzheng, et autres
Publié: (2025)
par: Zhang, Zongzheng, et autres
Publié: (2025)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
par: Zhu, Ziyue, et autres
Publié: (2026)
par: Zhu, Ziyue, et autres
Publié: (2026)
LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
par: Ding, Hongyu, et autres
Publié: (2025)
par: Ding, Hongyu, et autres
Publié: (2025)
Documents similaires
-
Policy Contrastive Decoding for Robotic Foundation Models
par: Wu, Shihan, et autres
Publié: (2025) -
Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation
par: Zhu, Junhong, et autres
Publié: (2026) -
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025) -
A Closer Look at Conditional Prompt Tuning for Vision-Language Models
par: Zhang, Ji, et autres
Publié: (2025) -
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)