SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models
Fuente:
arXiv
Saved in:
| Main Authors: | Choi, Hyeonbeom, Ahn, Daechul, Lee, Youhan, Kang, Taewook, Cho, Seongwon, Choi, Jonghyun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands
by: Cho, Seongwon, et al.
Published: (2025)
by: Cho, Seongwon, et al.
Published: (2025)
What Happens When: Learning Temporal Orders of Events in Videos
by: Ahn, Daechul, et al.
Published: (2025)
by: Ahn, Daechul, et al.
Published: (2025)
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
by: Ahn, Daechul, et al.
Published: (2025)
by: Ahn, Daechul, et al.
Published: (2025)
GenOL: Generating Diverse Examples for Name-only Online Learning
by: Seo, Minhyuk, et al.
Published: (2024)
by: Seo, Minhyuk, et al.
Published: (2024)
LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
by: Hong, Youngjin, et al.
Published: (2025)
by: Hong, Youngjin, et al.
Published: (2025)
Hierarchical Vision Language Action Model Using Success and Failure Demonstrations
by: Park, Jeongeun, et al.
Published: (2025)
by: Park, Jeongeun, et al.
Published: (2025)
Becoming Experienced Judges: Selective Test-Time Learning for Evaluators
by: Jwa, Seungyeon, et al.
Published: (2025)
by: Jwa, Seungyeon, et al.
Published: (2025)
Multi-Level Compositional Reasoning for Interactive Instruction Following
by: Bhambri, Suvaansh, et al.
Published: (2023)
by: Bhambri, Suvaansh, et al.
Published: (2023)
Multi-Modal Grounded Planning and Efficient Replanning For Learning Embodied Agents with A Few Examples
by: Kim, Taewoong, et al.
Published: (2024)
by: Kim, Taewoong, et al.
Published: (2024)
TTA-DAME: Test-Time Adaptation with Domain Augmentation and Model Ensemble for Dynamic Driving Conditions
by: Jeon, Dongjae, et al.
Published: (2025)
by: Jeon, Dongjae, et al.
Published: (2025)
When to Trust Imagination: Adaptive Action Execution for World Action Models
by: Wang, Rui, et al.
Published: (2026)
by: Wang, Rui, et al.
Published: (2026)
Can only LLMs do Reasoning?: Potential of Small Language Models in Task Planning
by: Choi, Gawon, et al.
Published: (2024)
by: Choi, Gawon, et al.
Published: (2024)
Adaptive Capacity Allocation for Vision Language Action Fine-tuning
by: Kim, Donghoon, et al.
Published: (2026)
by: Kim, Donghoon, et al.
Published: (2026)
Online Continual Learning For Interactive Instruction Following Agents
by: Kim, Byeonghwi, et al.
Published: (2024)
by: Kim, Byeonghwi, et al.
Published: (2024)
RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
by: Choi, Andrew, et al.
Published: (2026)
by: Choi, Andrew, et al.
Published: (2026)
Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents
by: Kim, Byeonghwi, et al.
Published: (2023)
by: Kim, Byeonghwi, et al.
Published: (2023)
Action Hallucination in Generative Vision-Language-Action Models
by: Soh, Harold, et al.
Published: (2026)
by: Soh, Harold, et al.
Published: (2026)
A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking
by: Zhang, Yuelin, et al.
Published: (2026)
by: Zhang, Yuelin, et al.
Published: (2026)
RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models
by: Sridhar, Kaustubh, et al.
Published: (2025)
by: Sridhar, Kaustubh, et al.
Published: (2025)
Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting
by: Lee, Sangoh, et al.
Published: (2025)
by: Lee, Sangoh, et al.
Published: (2025)
ReALFRED: An Embodied Instruction Following Benchmark in Photo-Realistic Environments
by: Kim, Taewoong, et al.
Published: (2024)
by: Kim, Taewoong, et al.
Published: (2024)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
by: Hu, Yutong, et al.
Published: (2026)
by: Hu, Yutong, et al.
Published: (2026)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
by: Dai, Yuntao, et al.
Published: (2025)
by: Dai, Yuntao, et al.
Published: (2025)
Temporal Action Representation Learning for Tactical Resource Control and Subsequent Maneuver Generation
by: Jung, Hoseong, et al.
Published: (2026)
by: Jung, Hoseong, et al.
Published: (2026)
Adversarial Attacks on Robotic Vision Language Action Models
by: Jones, Eliot Krzysztof, et al.
Published: (2025)
by: Jones, Eliot Krzysztof, et al.
Published: (2025)
Survey of Vision-Language-Action Models for Embodied Manipulation
by: Li, Haoran, et al.
Published: (2025)
by: Li, Haoran, et al.
Published: (2025)
Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning
by: Ahn, Sanghyun, et al.
Published: (2025)
by: Ahn, Sanghyun, et al.
Published: (2025)
CarPLAN: Context-Adaptive and Robust Planning with Dynamic Scene Awareness for Autonomous Driving
by: Yun, Junyong, et al.
Published: (2026)
by: Yun, Junyong, et al.
Published: (2026)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
by: Wang, Taowen, et al.
Published: (2024)
by: Wang, Taowen, et al.
Published: (2024)
Developing Vision-Language-Action Model from Egocentric Videos
by: Yoshida, Tomoya, et al.
Published: (2025)
by: Yoshida, Tomoya, et al.
Published: (2025)
Emergence of Human to Robot Transfer in Vision-Language-Action Models
by: Kareer, Simar, et al.
Published: (2025)
by: Kareer, Simar, et al.
Published: (2025)
SAFE: Multitask Failure Detection for Vision-Language-Action Models
by: Gu, Qiao, et al.
Published: (2025)
by: Gu, Qiao, et al.
Published: (2025)
Continually Evolving Skill Knowledge in Vision Language Action Model
by: Wu, Yuxuan, et al.
Published: (2025)
by: Wu, Yuxuan, et al.
Published: (2025)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
by: Yang, Rushuai, et al.
Published: (2026)
by: Yang, Rushuai, et al.
Published: (2026)
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
by: Zhu, Fangqi, et al.
Published: (2025)
by: Zhu, Fangqi, et al.
Published: (2025)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
by: Xiong, Zheng, et al.
Published: (2025)
by: Xiong, Zheng, et al.
Published: (2025)
V-VLAPS: Value-Guided Planning for Vision-Language-Action Models
by: Ren, Ke, et al.
Published: (2026)
by: Ren, Ke, et al.
Published: (2026)
Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation
by: Zhang, Yihao, et al.
Published: (2025)
by: Zhang, Yihao, et al.
Published: (2025)
10 Open Challenges Steering the Future of Vision-Language-Action Models
by: Poria, Soujanya, et al.
Published: (2025)
by: Poria, Soujanya, et al.
Published: (2025)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
by: Zhang, Dapeng, et al.
Published: (2025)
by: Zhang, Dapeng, et al.
Published: (2025)
Similar Items
-
BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands
by: Cho, Seongwon, et al.
Published: (2025) -
What Happens When: Learning Temporal Orders of Events in Videos
by: Ahn, Daechul, et al.
Published: (2025) -
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
by: Ahn, Daechul, et al.
Published: (2025) -
GenOL: Generating Diverse Examples for Name-only Online Learning
by: Seo, Minhyuk, et al.
Published: (2024) -
LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
by: Hong, Youngjin, et al.
Published: (2025)