NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Jierui, Zhang, Yanyan, Duan, Yicheng, Liang, Tuo, Chaudhary, Vipin, Yin, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Navigation Framework Utilizing Vision-Language Models
por: Duan, Yicheng, et al.
Publicado: (2025)
por: Duan, Yicheng, et al.
Publicado: (2025)
Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models
por: Zhang, Yanyan, et al.
Publicado: (2026)
por: Zhang, Yanyan, et al.
Publicado: (2026)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
por: Yu, Zhuoyuan, et al.
Publicado: (2025)
por: Yu, Zhuoyuan, et al.
Publicado: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
por: Lei, Zixing, et al.
Publicado: (2026)
por: Lei, Zixing, et al.
Publicado: (2026)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
por: Liu, Yicheng, et al.
Publicado: (2025)
por: Liu, Yicheng, et al.
Publicado: (2025)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026)
por: Tang, Zuojin, et al.
Publicado: (2026)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
por: Perincherry, Akhil, et al.
Publicado: (2025)
por: Perincherry, Akhil, et al.
Publicado: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
por: Shen, Boyang, et al.
Publicado: (2026)
por: Shen, Boyang, et al.
Publicado: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
por: Si, Shengyu, et al.
Publicado: (2026)
por: Si, Shengyu, et al.
Publicado: (2026)
AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control
por: Xu, Peng, et al.
Publicado: (2026)
por: Xu, Peng, et al.
Publicado: (2026)
Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning
por: Qi, Xiuxiu, et al.
Publicado: (2025)
por: Qi, Xiuxiu, et al.
Publicado: (2025)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting
por: Lin, Juyi, et al.
Publicado: (2025)
por: Lin, Juyi, et al.
Publicado: (2025)
ROSA: Harnessing Robot States for Vision-Language and Action Alignment
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
por: Wang, Guodong, et al.
Publicado: (2026)
por: Wang, Guodong, et al.
Publicado: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
por: Wang, Chaoyang, et al.
Publicado: (2026)
por: Wang, Chaoyang, et al.
Publicado: (2026)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
por: Kim, Moo Jin, et al.
Publicado: (2025)
por: Kim, Moo Jin, et al.
Publicado: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
por: Jiang, Anqing, et al.
Publicado: (2025)
por: Jiang, Anqing, et al.
Publicado: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
por: Ye, Jinhui, et al.
Publicado: (2026)
por: Ye, Jinhui, et al.
Publicado: (2026)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
por: Kim, Ju-Young, et al.
Publicado: (2025)
por: Kim, Ju-Young, et al.
Publicado: (2025)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
por: Guo, Jianing, et al.
Publicado: (2025)
por: Guo, Jianing, et al.
Publicado: (2025)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
por: Wang, Hanzhen, et al.
Publicado: (2025)
por: Wang, Hanzhen, et al.
Publicado: (2025)
Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models
por: Bendikas, Rokas, et al.
Publicado: (2025)
por: Bendikas, Rokas, et al.
Publicado: (2025)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
por: Fan, Qingyu, et al.
Publicado: (2026)
por: Fan, Qingyu, et al.
Publicado: (2026)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
por: Wang, Beichen, et al.
Publicado: (2024)
por: Wang, Beichen, et al.
Publicado: (2024)
A Survey on Efficient Vision-Language-Action Models
por: Yu, Zhaoshu, et al.
Publicado: (2025)
por: Yu, Zhaoshu, et al.
Publicado: (2025)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
por: Gao, Chongkai, et al.
Publicado: (2025)
por: Gao, Chongkai, et al.
Publicado: (2025)
StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
por: Community, StarVLA
Publicado: (2026)
por: Community, StarVLA
Publicado: (2026)
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)
por: Wang, Yiru, et al.
Publicado: (2026)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
por: Zhao, Ruiteng, et al.
Publicado: (2026)
por: Zhao, Ruiteng, et al.
Publicado: (2026)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
por: Chen, Xinyi, et al.
Publicado: (2025)
por: Chen, Xinyi, et al.
Publicado: (2025)
OG-VLA: Orthographic Image Generation for 3D-Aware Vision-Language Action Model
por: Singh, Ishika, et al.
Publicado: (2025)
por: Singh, Ishika, et al.
Publicado: (2025)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
por: Zheng, Jinliang, et al.
Publicado: (2025)
por: Zheng, Jinliang, et al.
Publicado: (2025)
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
Hybrid Training for Vision-Language-Action Models
por: Mazzaglia, Pietro, et al.
Publicado: (2025)
por: Mazzaglia, Pietro, et al.
Publicado: (2025)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
por: Hou, Zhi, et al.
Publicado: (2025)
por: Hou, Zhi, et al.
Publicado: (2025)
Ejemplares similares
-
A Navigation Framework Utilizing Vision-Language Models
por: Duan, Yicheng, et al.
Publicado: (2025) -
Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models
por: Zhang, Yanyan, et al.
Publicado: (2026) -
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
por: Yu, Zhuoyuan, et al.
Publicado: (2025) -
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
por: Lei, Zixing, et al.
Publicado: (2026) -
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
por: Liu, Yicheng, et al.
Publicado: (2025)