PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Wenqi, Sun, Gan, He, Yao, Dong, Jiahua, Dai, Suyan, Laptev, Ivan, Khan, Salman, Cong, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Never-Ending Behavior-Cloning Agent for Robotic Manipulation
di: Liang, Wenqi, et al.
Pubblicazione: (2024)
di: Liang, Wenqi, et al.
Pubblicazione: (2024)
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
di: Liu, Chenghao, et al.
Pubblicazione: (2025)
di: Liu, Chenghao, et al.
Pubblicazione: (2025)
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
di: Bao, Muyi, et al.
Pubblicazione: (2026)
di: Bao, Muyi, et al.
Pubblicazione: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
di: Guo, Minghao, et al.
Pubblicazione: (2025)
di: Guo, Minghao, et al.
Pubblicazione: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026)
di: Sun, Jianli, et al.
Pubblicazione: (2026)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
di: Lin, Yihan, et al.
Pubblicazione: (2026)
di: Lin, Yihan, et al.
Pubblicazione: (2026)
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
di: Hu, Yutong, et al.
Pubblicazione: (2026)
di: Hu, Yutong, et al.
Pubblicazione: (2026)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
di: Sun, Nan, et al.
Pubblicazione: (2025)
di: Sun, Nan, et al.
Pubblicazione: (2025)
RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model
di: Li, Shunlei, et al.
Pubblicazione: (2024)
di: Li, Shunlei, et al.
Pubblicazione: (2024)
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
di: Li, Xiaoqi, et al.
Pubblicazione: (2026)
di: Li, Xiaoqi, et al.
Pubblicazione: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
EdgeVLA: Efficient Vision-Language-Action Models
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
di: Zhang, Rongyu, et al.
Pubblicazione: (2025)
Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing
di: Khan, Muhamamd Haris, et al.
Pubblicazione: (2025)
di: Khan, Muhamamd Haris, et al.
Pubblicazione: (2025)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
di: Zhang, Yichi, et al.
Pubblicazione: (2026)
di: Zhang, Yichi, et al.
Pubblicazione: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
di: Apanasevich, I., et al.
Pubblicazione: (2026)
di: Apanasevich, I., et al.
Pubblicazione: (2026)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
di: Kong, Weijie, et al.
Pubblicazione: (2026)
di: Kong, Weijie, et al.
Pubblicazione: (2026)
SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Whole-Body Control Through Narrow Gaps From Pixels To Action
di: Wu, Tianyue, et al.
Pubblicazione: (2024)
di: Wu, Tianyue, et al.
Pubblicazione: (2024)
SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios
di: Gao, Tian, et al.
Pubblicazione: (2026)
di: Gao, Tian, et al.
Pubblicazione: (2026)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
di: Hu, Xintong, et al.
Pubblicazione: (2026)
di: Hu, Xintong, et al.
Pubblicazione: (2026)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
di: Fan, Yiguo, et al.
Pubblicazione: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
di: Li, Boyu, et al.
Pubblicazione: (2026)
di: Li, Boyu, et al.
Pubblicazione: (2026)
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
di: Wen, Junjie, et al.
Pubblicazione: (2026)
di: Wen, Junjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Never-Ending Behavior-Cloning Agent for Robotic Manipulation
di: Liang, Wenqi, et al.
Pubblicazione: (2024) -
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
di: Liu, Chenghao, et al.
Pubblicazione: (2025) -
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
di: Bao, Muyi, et al.
Pubblicazione: (2026) -
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026) -
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
di: Guo, Minghao, et al.
Pubblicazione: (2025)