From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Yihan, Li, Haoyang, Li, Yang, Shen, Haitao, Zhao, Yihan, Shao, Chao, Zhang, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
por: Zhao, Chen, et al.
Publicado: (2026)
por: Zhao, Chen, et al.
Publicado: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
por: Liang, Wenqi, et al.
Publicado: (2025)
por: Liang, Wenqi, et al.
Publicado: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
por: Li, Yixuan, et al.
Publicado: (2025)
por: Li, Yixuan, et al.
Publicado: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
por: Liu, Yicheng, et al.
Publicado: (2025)
por: Liu, Yicheng, et al.
Publicado: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
por: Wang, Yating, et al.
Publicado: (2025)
por: Wang, Yating, et al.
Publicado: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026)
por: Tang, Zuojin, et al.
Publicado: (2026)
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
por: Ye, Wencheng, et al.
Publicado: (2025)
por: Ye, Wencheng, et al.
Publicado: (2025)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
por: Govind, Manish Kumar, et al.
Publicado: (2026)
por: Govind, Manish Kumar, et al.
Publicado: (2026)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
por: Li, Chenyang, et al.
Publicado: (2026)
por: Li, Chenyang, et al.
Publicado: (2026)
CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos
por: Zhang, Chubin, et al.
Publicado: (2026)
por: Zhang, Chubin, et al.
Publicado: (2026)
From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation
por: Li, Yajie, et al.
Publicado: (2026)
por: Li, Yajie, et al.
Publicado: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
por: Sun, Jingwen, et al.
Publicado: (2026)
por: Sun, Jingwen, et al.
Publicado: (2026)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
por: Nie, Dujun, et al.
Publicado: (2026)
por: Nie, Dujun, et al.
Publicado: (2026)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
por: Lin, Tao, et al.
Publicado: (2025)
por: Lin, Tao, et al.
Publicado: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
Vision Language Action Models in Robotic Manipulation: A Systematic Review
por: Din, Muhayy Ud, et al.
Publicado: (2025)
por: Din, Muhayy Ud, et al.
Publicado: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
por: Zhao, Baining, et al.
Publicado: (2026)
por: Zhao, Baining, et al.
Publicado: (2026)
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
por: Li, Haosheng, et al.
Publicado: (2026)
por: Li, Haosheng, et al.
Publicado: (2026)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
por: Xu, Yuhao, et al.
Publicado: (2026)
por: Xu, Yuhao, et al.
Publicado: (2026)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
por: Yang, Jiabing, et al.
Publicado: (2026)
por: Yang, Jiabing, et al.
Publicado: (2026)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
por: Shi, Yiran, et al.
Publicado: (2026)
por: Shi, Yiran, et al.
Publicado: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
por: Lv, Qi, et al.
Publicado: (2025)
por: Lv, Qi, et al.
Publicado: (2025)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
por: Shao, Rui, et al.
Publicado: (2025)
por: Shao, Rui, et al.
Publicado: (2025)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
por: Wang, Linbo, et al.
Publicado: (2026)
por: Wang, Linbo, et al.
Publicado: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
por: Yang, Yurou, et al.
Publicado: (2026)
por: Yang, Yurou, et al.
Publicado: (2026)
ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance
por: Li, Zhuohao, et al.
Publicado: (2026)
por: Li, Zhuohao, et al.
Publicado: (2026)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
por: Lin, Haitao, et al.
Publicado: (2026)
por: Lin, Haitao, et al.
Publicado: (2026)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
por: Zhang, Zhengshen, et al.
Publicado: (2025)
por: Zhang, Zhengshen, et al.
Publicado: (2025)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
por: Lin, Tao, et al.
Publicado: (2026)
por: Lin, Tao, et al.
Publicado: (2026)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
por: GigaBrain Team, et al.
Publicado: (2025)
por: GigaBrain Team, et al.
Publicado: (2025)
Ejemplares similares
-
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
por: Zhao, Chen, et al.
Publicado: (2026) -
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026) -
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
por: Liang, Wenqi, et al.
Publicado: (2025) -
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
por: Li, Yixuan, et al.
Publicado: (2025) -
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
por: Liu, Yicheng, et al.
Publicado: (2025)