ACTLLM: Action Consistency Tuned Large Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Bi, Jing, Wen, Lianggong Bruce, Liu, Zhang, Xu, Chenliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
por: Luo, Jingzhou, et al.
Publicado: (2026)
por: Luo, Jingzhou, et al.
Publicado: (2026)
Action Contextualization: Adaptive Task Planning and Action Tuning using Large Language Models
por: Gupta, Sthithpragya, et al.
Publicado: (2024)
por: Gupta, Sthithpragya, et al.
Publicado: (2024)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026)
por: Tang, Zuojin, et al.
Publicado: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
RT-Grasp: Reasoning Tuning Robotic Grasping via Multi-modal Large Language Model
por: Xu, Jinxuan, et al.
Publicado: (2024)
por: Xu, Jinxuan, et al.
Publicado: (2024)
STARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action Models
por: Xu, Feng, et al.
Publicado: (2025)
por: Xu, Feng, et al.
Publicado: (2025)
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
por: Niu, Haochen, et al.
Publicado: (2026)
por: Niu, Haochen, et al.
Publicado: (2026)
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
por: Liu, Yudong, et al.
Publicado: (2026)
por: Liu, Yudong, et al.
Publicado: (2026)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
por: Xu, Chao, et al.
Publicado: (2025)
por: Xu, Chao, et al.
Publicado: (2025)
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
por: Hancock, Asher J., et al.
Publicado: (2025)
por: Hancock, Asher J., et al.
Publicado: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
por: Lyu, Mingyang, et al.
Publicado: (2025)
por: Lyu, Mingyang, et al.
Publicado: (2025)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
por: Xu, Haiweng, et al.
Publicado: (2026)
por: Xu, Haiweng, et al.
Publicado: (2026)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
por: Yang, Jiabing, et al.
Publicado: (2026)
por: Yang, Jiabing, et al.
Publicado: (2026)
Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models
por: Wen, Siqi, et al.
Publicado: (2026)
por: Wen, Siqi, et al.
Publicado: (2026)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
por: Li, Xiaoqi, et al.
Publicado: (2025)
por: Li, Xiaoqi, et al.
Publicado: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
por: Li, Boyu, et al.
Publicado: (2026)
por: Li, Boyu, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
por: Zhong, Yifan, et al.
Publicado: (2025)
por: Zhong, Yifan, et al.
Publicado: (2025)
Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs
por: Mavrogiannis, Angelos, et al.
Publicado: (2024)
por: Mavrogiannis, Angelos, et al.
Publicado: (2024)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
por: Liu, Zhuoyang, et al.
Publicado: (2025)
por: Liu, Zhuoyang, et al.
Publicado: (2025)
VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
por: Bi, Jianxin, et al.
Publicado: (2025)
por: Bi, Jianxin, et al.
Publicado: (2025)
Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
por: Huang, Dongchi, et al.
Publicado: (2025)
por: Huang, Dongchi, et al.
Publicado: (2025)
InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning
por: Zhang, Ji, et al.
Publicado: (2025)
por: Zhang, Ji, et al.
Publicado: (2025)
Cross-Hand Latent Representation for Vision-Language-Action Models
por: Jiang, Guangqi, et al.
Publicado: (2026)
por: Jiang, Guangqi, et al.
Publicado: (2026)
MWM: Mobile World Models for Action-Conditioned Consistent Prediction
por: Yan, Han, et al.
Publicado: (2026)
por: Yan, Han, et al.
Publicado: (2026)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
por: Peng, Xiongfeng, et al.
Publicado: (2026)
por: Peng, Xiongfeng, et al.
Publicado: (2026)
Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
por: Sun, Ming, et al.
Publicado: (2026)
por: Sun, Ming, et al.
Publicado: (2026)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
por: Shao, Rui, et al.
Publicado: (2025)
por: Shao, Rui, et al.
Publicado: (2025)
Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models
por: Zhang, Hanxin, et al.
Publicado: (2026)
por: Zhang, Hanxin, et al.
Publicado: (2026)
G$ \mathbf{^2} $VD Planner: Efficient Motion Planning With Grid-based Generalized Voronoi Diagrams
por: Wen, Jian, et al.
Publicado: (2022)
por: Wen, Jian, et al.
Publicado: (2022)
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
por: Zhang, Kaidong, et al.
Publicado: (2026)
por: Zhang, Kaidong, et al.
Publicado: (2026)
Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models
por: Liu, Haoyun, et al.
Publicado: (2026)
por: Liu, Haoyun, et al.
Publicado: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary
por: Liu, Zhirui, et al.
Publicado: (2025)
por: Liu, Zhirui, et al.
Publicado: (2025)
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
por: Wulff, Theodor, et al.
Publicado: (2026)
por: Wulff, Theodor, et al.
Publicado: (2026)
Ejemplares similares
-
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024) -
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
por: Luo, Jingzhou, et al.
Publicado: (2026) -
Action Contextualization: Adaptive Task Planning and Action Tuning using Large Language Models
por: Gupta, Sthithpragya, et al.
Publicado: (2024) -
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026) -
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)