QuoVLA: Quotient Space for Vision-Language-Action Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Xuan, Wu, Yinan, Duan, Haoran, Han, Jungong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
por: Li, Yixuan, et al.
Publicado: (2025)
por: Li, Yixuan, et al.
Publicado: (2025)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
THU-Warwick Submission for EPIC-KITCHEN Challenge 2025: Semi-Supervised Video Object Segmentation
por: Gao, Mingqi, et al.
Publicado: (2025)
por: Gao, Mingqi, et al.
Publicado: (2025)
Rethinking Score Distilling Sampling for 3D Editing and Generation
por: Miao, Xingyu, et al.
Publicado: (2025)
por: Miao, Xingyu, et al.
Publicado: (2025)
EvoVLA: Self-Evolving Vision-Language-Action Model
por: Liu, Zeting, et al.
Publicado: (2025)
por: Liu, Zeting, et al.
Publicado: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
por: Ye, Angen, et al.
Publicado: (2025)
por: Ye, Angen, et al.
Publicado: (2025)
Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
por: Yang, Yantai, et al.
Publicado: (2025)
por: Yang, Yantai, et al.
Publicado: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
por: Li, Runhao, et al.
Publicado: (2025)
por: Li, Runhao, et al.
Publicado: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
por: Wang, Hongyu, et al.
Publicado: (2025)
por: Wang, Hongyu, et al.
Publicado: (2025)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
por: Luo, Yuechen, et al.
Publicado: (2026)
por: Luo, Yuechen, et al.
Publicado: (2026)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
por: Chi, Haohan, et al.
Publicado: (2025)
por: Chi, Haohan, et al.
Publicado: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models
por: Zhou, Zheyuan, et al.
Publicado: (2026)
por: Zhou, Zheyuan, et al.
Publicado: (2026)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
por: Zheng, Jinliang, et al.
Publicado: (2025)
por: Zheng, Jinliang, et al.
Publicado: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
por: Cheng, Jintao, et al.
Publicado: (2026)
por: Cheng, Jintao, et al.
Publicado: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
por: Sun, Jingwen, et al.
Publicado: (2026)
por: Sun, Jingwen, et al.
Publicado: (2026)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
por: Dong, Shaoqi, et al.
Publicado: (2025)
por: Dong, Shaoqi, et al.
Publicado: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
por: Wang, Yating, et al.
Publicado: (2025)
por: Wang, Yating, et al.
Publicado: (2025)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
por: Zhang, Qiyao, et al.
Publicado: (2026)
por: Zhang, Qiyao, et al.
Publicado: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
por: Du, Fan, et al.
Publicado: (2026)
por: Du, Fan, et al.
Publicado: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
por: Yuan, Tianyuan, et al.
Publicado: (2025)
por: Yuan, Tianyuan, et al.
Publicado: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
por: Shi, Yiran, et al.
Publicado: (2026)
por: Shi, Yiran, et al.
Publicado: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
por: Zhou, Zewei, et al.
Publicado: (2026)
por: Zhou, Zewei, et al.
Publicado: (2026)
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
por: You, Zihan, et al.
Publicado: (2026)
por: You, Zihan, et al.
Publicado: (2026)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
por: Zhao, Ruiteng, et al.
Publicado: (2026)
por: Zhao, Ruiteng, et al.
Publicado: (2026)
Ejemplares similares
-
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
por: Wang, Xin, et al.
Publicado: (2025) -
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023) -
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
por: Li, Yixuan, et al.
Publicado: (2025) -
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
por: Zhang, Tianyi, et al.
Publicado: (2025) -
THU-Warwick Submission for EPIC-KITCHEN Challenge 2025: Semi-Supervised Video Object Segmentation
por: Gao, Mingqi, et al.
Publicado: (2025)