VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yihao, Ding, Pengxiang, Li, Lingxiao, Cui, Can, Ge, Zirui, Tong, Xinyang, Song, Wenxuan, Zhao, Han, Zhao, Wei, Hou, Pengxu, Huang, Siteng, Tang, Yifan, Wang, Wenhui, Zhang, Ru, Liu, Jianyi, Wang, Donglin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025)
por: Lin, Minghui, et al.
Publicado: (2025)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
por: Cui, Can, et al.
Publicado: (2024)
por: Cui, Can, et al.
Publicado: (2024)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
por: Fan, Yiguo, et al.
Publicado: (2025)
por: Fan, Yiguo, et al.
Publicado: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
por: Li, Hengtao, et al.
Publicado: (2025)
por: Li, Hengtao, et al.
Publicado: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Toward Copyright Integrity and Verifiability via Multi-Bit Watermarking for Intelligent Transportation Systems
por: Wang, Yihao, et al.
Publicado: (2025)
por: Wang, Yihao, et al.
Publicado: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
por: Zhao, Han, et al.
Publicado: (2024)
por: Zhao, Han, et al.
Publicado: (2024)
UP4LS: User Profile Constructed by Multiple Attributes for Enhancing Linguistic Steganalysis
por: Wang, Yihao, et al.
Publicado: (2023)
por: Wang, Yihao, et al.
Publicado: (2023)
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
Dynamically Allocated Interval-Based Generative Linguistic Steganography with Roulette Wheel
por: Wang, Yihao, et al.
Publicado: (2024)
por: Wang, Yihao, et al.
Publicado: (2024)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
State-of-the-art Advances of Deep-learning Linguistic Steganalysis Research
por: Wang, Yihao, et al.
Publicado: (2024)
por: Wang, Yihao, et al.
Publicado: (2024)
Linguistic Steganalysis via LLMs: Two Modes for Efficient Detection of Strongly Concealed Stego
por: Tang, Yifan, et al.
Publicado: (2024)
por: Tang, Yifan, et al.
Publicado: (2024)
Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration
por: Ding, Pengxiang, et al.
Publicado: (2025)
por: Ding, Pengxiang, et al.
Publicado: (2025)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
por: Tong, Xinyang, et al.
Publicado: (2024)
por: Tong, Xinyang, et al.
Publicado: (2024)
GeRM: A Generalist Robotic Model with Mixture-of-experts for Quadruped Robot
por: Song, Wenxuan, et al.
Publicado: (2024)
por: Song, Wenxuan, et al.
Publicado: (2024)
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)
por: Zeng, Qixin, et al.
Publicado: (2026)
Letter: Deoxycholic Acid‐Driven HBV Persistence: A Paradigm Shift That Demands Therapeutic Translation
por: Jingru Ge, et al.
Publicado: (2026)
por: Jingru Ge, et al.
Publicado: (2026)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation
por: Jia, Bofang, et al.
Publicado: (2024)
por: Jia, Bofang, et al.
Publicado: (2024)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
por: Gong, Zhefei, et al.
Publicado: (2024)
por: Gong, Zhefei, et al.
Publicado: (2024)
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
WorldVLA: Towards Autoregressive Action World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models
por: Ge, Zirui, et al.
Publicado: (2026)
por: Ge, Zirui, et al.
Publicado: (2026)
An Enhanced Prompt-Based LLM Reasoning Scheme via Knowledge Graph-Integrated Collaboration
por: Li, Yihao, et al.
Publicado: (2024)
por: Li, Yihao, et al.
Publicado: (2024)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
RynnVLA-002: A Unified Vision-Language-Action and World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
U-GIFT: Uncertainty-Guided Firewall for Toxic Speech in Few-Shot Scenario
por: Song, Jiaxin, et al.
Publicado: (2025)
por: Song, Jiaxin, et al.
Publicado: (2025)
Ejemplares similares
-
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023) -
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
por: Lin, Minghui, et al.
Publicado: (2025) -
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
por: Cui, Can, et al.
Publicado: (2025) -
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025) -
MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
por: Zhao, Han, et al.
Publicado: (2025)