Adaptive Capacity Allocation for Vision Language Action Fine-tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Donghoon, Bae, Minji, Nam, Unghui, Kim, Gyeonghun, Lee, Suyun, Shim, Kyuhong, Shim, Byonghyo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models
par: Kim, Donghoon, et autres
Publié: (2025)
par: Kim, Donghoon, et autres
Publié: (2025)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024)
par: Kim, Donghoon, et autres
Publié: (2024)
Learning Primitive Relations for Compositional Zero-Shot Learning
par: Lee, Insu, et autres
Publié: (2025)
par: Lee, Insu, et autres
Publié: (2025)
Revealing Multi-View Hallucination in Large Vision-Language Models
par: Park, Wooje, et autres
Publié: (2026)
par: Park, Wooje, et autres
Publié: (2026)
Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
par: Lee, Insu, et autres
Publié: (2025)
par: Lee, Insu, et autres
Publié: (2025)
Role of Sensing and Computer Vision in 6G Wireless Communications
par: Kim, Seungnyun, et autres
Publié: (2024)
par: Kim, Seungnyun, et autres
Publié: (2024)
TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization
par: Chen, Zengjue, et autres
Publié: (2025)
par: Chen, Zengjue, et autres
Publié: (2025)
Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
par: Kang, Jaehoon, et autres
Publié: (2026)
par: Kang, Jaehoon, et autres
Publié: (2026)
Unlocking Transfer Learning for Open-World Few-Shot Recognition
par: Kim, Byeonggeun, et autres
Publié: (2024)
par: Kim, Byeonggeun, et autres
Publié: (2024)
Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey
par: Yang, Hyun Jong, et autres
Publié: (2026)
par: Yang, Hyun Jong, et autres
Publié: (2026)
TempFuser: Learning Agile, Tactical, and Acrobatic Flight Maneuvers Using a Long Short-Term Temporal Fusion Transformer
par: Seong, Hyunki, et autres
Publié: (2023)
par: Seong, Hyunki, et autres
Publié: (2023)
ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning
par: Kim, Byung-ju, et autres
Publié: (2025)
par: Kim, Byung-ju, et autres
Publié: (2025)
Verifier-free Test-Time Sampling for Vision Language Action Models
par: Jang, Suhyeok, et autres
Publié: (2025)
par: Jang, Suhyeok, et autres
Publié: (2025)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
par: Hu, Xintong, et autres
Publié: (2026)
par: Hu, Xintong, et autres
Publié: (2026)
REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning
par: Gu, Zhaoyuan, et autres
Publié: (2026)
par: Gu, Zhaoyuan, et autres
Publié: (2026)
Active Test-time Vision-Language Navigation
par: Ko, Heeju, et autres
Publié: (2025)
par: Ko, Heeju, et autres
Publié: (2025)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)
par: Kim, Ju-Young, et autres
Publié: (2025)
Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching
par: Moon, Junwon, et autres
Publié: (2026)
par: Moon, Junwon, et autres
Publié: (2026)
Grounding Driving VLA via Inverse Kinematics
par: Park, Junsung, et autres
Publié: (2026)
par: Park, Junsung, et autres
Publié: (2026)
GraspCorrect: Robotic Grasp Correction via Vision-Language Model-Guided Feedback
par: Lee, Sungjae, et autres
Publié: (2025)
par: Lee, Sungjae, et autres
Publié: (2025)
Action Hallucination in Generative Vision-Language-Action Models
par: Soh, Harold, et autres
Publié: (2026)
par: Soh, Harold, et autres
Publié: (2026)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
par: Kim, Jisoo, et autres
Publié: (2026)
par: Kim, Jisoo, et autres
Publié: (2026)
SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models
par: Choi, Hyeonbeom, et autres
Publié: (2026)
par: Choi, Hyeonbeom, et autres
Publié: (2026)
Chain-of-Rank: Enhancing Large Language Models for Domain-Specific RAG in Edge Device
par: Lee, Juntae, et autres
Publié: (2025)
par: Lee, Juntae, et autres
Publié: (2025)
A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking
par: Zhang, Yuelin, et autres
Publié: (2026)
par: Zhang, Yuelin, et autres
Publié: (2026)
Understanding Physical Properties of Unseen Deformable Objects by Leveraging Large Language Models and Robot Actions
par: Park, Changmin, et autres
Publié: (2025)
par: Park, Changmin, et autres
Publié: (2025)
Learning Semantic Traversability with Egocentric Video and Automated Annotation Strategy
par: Kim, Yunho, et autres
Publié: (2024)
par: Kim, Yunho, et autres
Publié: (2024)
Legged Robot State Estimation With Invariant Extended Kalman Filter Using Neural Measurement Network
par: Youm, Donghoon, et autres
Publié: (2024)
par: Youm, Donghoon, et autres
Publié: (2024)
RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models
par: Sridhar, Kaustubh, et autres
Publié: (2025)
par: Sridhar, Kaustubh, et autres
Publié: (2025)
Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
par: Liu, Huihan, et autres
Publié: (2026)
par: Liu, Huihan, et autres
Publié: (2026)
Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting
par: Lee, Sangoh, et autres
Publié: (2025)
par: Lee, Sangoh, et autres
Publié: (2025)
Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
par: Pei, Xiaohuan, et autres
Publié: (2025)
par: Pei, Xiaohuan, et autres
Publié: (2025)
Hierarchical Vision Language Action Model Using Success and Failure Demonstrations
par: Park, Jeongeun, et autres
Publié: (2025)
par: Park, Jeongeun, et autres
Publié: (2025)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
par: Lee, Hanna, et autres
Publié: (2026)
par: Lee, Hanna, et autres
Publié: (2026)
CarPLAN: Context-Adaptive and Robust Planning with Dynamic Scene Awareness for Autonomous Driving
par: Yun, Junyong, et autres
Publié: (2026)
par: Yun, Junyong, et autres
Publié: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
par: Hu, Yutong, et autres
Publié: (2026)
par: Hu, Yutong, et autres
Publié: (2026)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
par: Dai, Yuntao, et autres
Publié: (2025)
par: Dai, Yuntao, et autres
Publié: (2025)
Self-Corrective Task Planning by Inverse Prompting with Large Language Models
par: Lee, Jiho, et autres
Publié: (2025)
par: Lee, Jiho, et autres
Publié: (2025)
Reinforcement Learning-based Fault-Tolerant Control for Quadrotor with Online Transformer Adaptation
par: Kim, Dohyun, et autres
Publié: (2025)
par: Kim, Dohyun, et autres
Publié: (2025)
Documents similaires
-
Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models
par: Kim, Donghoon, et autres
Publié: (2025) -
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024) -
Learning Primitive Relations for Compositional Zero-Shot Learning
par: Lee, Insu, et autres
Publié: (2025) -
Revealing Multi-View Hallucination in Large Vision-Language Models
par: Park, Wooje, et autres
Publié: (2026) -
Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
par: Lee, Insu, et autres
Publié: (2025)