Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Haresh, Sanjay, Dijkman, Daniel, Bhattacharyya, Apratim, Memisevic, Roland |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ClevrSkills: Compositional Language and Visual Reasoning in Robotics
par: Haresh, Sanjay, et autres
Publié: (2024)
par: Haresh, Sanjay, et autres
Publié: (2024)
Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models
par: Bendikas, Rokas, et autres
Publié: (2025)
par: Bendikas, Rokas, et autres
Publié: (2025)
Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
par: Bhattacharyya, Apratim, et autres
Publié: (2025)
par: Bhattacharyya, Apratim, et autres
Publié: (2025)
Information-driven Affordance Discovery for Efficient Robotic Manipulation
par: Mazzaglia, Pietro, et autres
Publié: (2023)
par: Mazzaglia, Pietro, et autres
Publié: (2023)
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
par: Xu, Siyu, et autres
Publié: (2025)
par: Xu, Siyu, et autres
Publié: (2025)
Delayed Attention Training Improves Length Generalization in Transformer--RNN Hybrids
par: Phan, Buu, et autres
Publié: (2025)
par: Phan, Buu, et autres
Publié: (2025)
The Price Is Not Right: Neuro-Symbolic Methods Outperform VLAs on Structured Long-Horizon Manipulation Tasks with Significantly Lower Energy Consumption
par: Duggan, Timothy, et autres
Publié: (2026)
par: Duggan, Timothy, et autres
Publié: (2026)
Information-driven Affordance Discovery for Efficient Robotic Manipulation
par: Mazzaglia, Pietro, et autres
Publié: (2024)
par: Mazzaglia, Pietro, et autres
Publié: (2024)
Running VLAs at Real-time Speed
par: Ma, Yunchao, et autres
Publié: (2025)
par: Ma, Yunchao, et autres
Publié: (2025)
Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs
par: Zhao, Jianchao, et autres
Publié: (2026)
par: Zhao, Jianchao, et autres
Publié: (2026)
Aligning Robot Navigation Behaviors with Human Intentions and Preferences
par: Karnan, Haresh
Publié: (2024)
par: Karnan, Haresh
Publié: (2024)
SITCOM: Scaling Inference-Time COMpute for VLAs
par: Saxena, Ayudh, et autres
Publié: (2025)
par: Saxena, Ayudh, et autres
Publié: (2025)
Shallow-π: Knowledge Distillation for Flow-based VLAs
par: Jeon, Boseong, et autres
Publié: (2026)
par: Jeon, Boseong, et autres
Publié: (2026)
Primitive Subspaces Mediate Few-Shot Transfer in VLAs
par: Singh, Anya, et autres
Publié: (2026)
par: Singh, Anya, et autres
Publié: (2026)
VLAs are Confined yet Capable of Generalizing to Novel Instructions
par: Li, Quanyi
Publié: (2025)
par: Li, Quanyi
Publié: (2025)
From Code to Action: Hierarchical Learning of Diffusion-VLM Policies
par: Peschl, Markus, et autres
Publié: (2025)
par: Peschl, Markus, et autres
Publié: (2025)
How VLAs (Really) Work In Open-World Environments
par: Rasouli, Amir, et autres
Publié: (2026)
par: Rasouli, Amir, et autres
Publié: (2026)
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
par: Hancock, Asher J., et autres
Publié: (2025)
par: Hancock, Asher J., et autres
Publié: (2025)
How Do VLAs Effectively Inherit from VLMs?
par: Zhang, Chuheng, et autres
Publié: (2025)
par: Zhang, Chuheng, et autres
Publié: (2025)
cVLA: Towards Efficient Camera-Space VLAs
par: Argus, Max, et autres
Publié: (2025)
par: Argus, Max, et autres
Publié: (2025)
FASTER: Rethinking Real-Time Flow VLAs
par: Lu, Yuxiang, et autres
Publié: (2026)
par: Lu, Yuxiang, et autres
Publié: (2026)
Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate
par: Yang, Chen, et autres
Publié: (2026)
par: Yang, Chen, et autres
Publié: (2026)
VLA-0: Building State-of-the-Art VLAs with Zero Modification
par: Goyal, Ankit, et autres
Publié: (2025)
par: Goyal, Ankit, et autres
Publié: (2025)
Look, Remember and Reason: Grounded reasoning in videos with language models
par: Bhattacharyya, Apratim, et autres
Publié: (2023)
par: Bhattacharyya, Apratim, et autres
Publié: (2023)
Can Vision-Language Models Answer Face to Face Questions in the Real-World?
par: Pourreza, Reza, et autres
Publié: (2025)
par: Pourreza, Reza, et autres
Publié: (2025)
When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs
par: Fang, Yu, et autres
Publié: (2026)
par: Fang, Yu, et autres
Publié: (2026)
FoAM: Foresight-Augmented Multi-Task Imitation Policy for Robotic Manipulation
par: Liu, Litao, et autres
Publié: (2024)
par: Liu, Litao, et autres
Publié: (2024)
Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning
par: Hou, Jingyi, et autres
Publié: (2026)
par: Hou, Jingyi, et autres
Publié: (2026)
Do World Action Models Generalize Better than VLAs? A Robustness Study
par: Zhang, Zhanguang, et autres
Publié: (2026)
par: Zhang, Zhanguang, et autres
Publié: (2026)
RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
par: Chen, Tianxing, et autres
Publié: (2026)
par: Chen, Tianxing, et autres
Publié: (2026)
MemoAct: Atkinson-Shiffrin-Inspired Memory-Augmented Visuomotor Policy for Robotic Manipulation
par: Tan, Liufan, et autres
Publié: (2026)
par: Tan, Liufan, et autres
Publié: (2026)
Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs
par: Priyadershi, Abhinaw, et autres
Publié: (2026)
par: Priyadershi, Abhinaw, et autres
Publié: (2026)
Task-Driven Manipulation with Reconfigurable Parallel Robots
par: Morton, Daniel, et autres
Publié: (2024)
par: Morton, Daniel, et autres
Publié: (2024)
Task-Driven Co-Design of Mobile Manipulators
par: Schneider, Raphael, et autres
Publié: (2024)
par: Schneider, Raphael, et autres
Publié: (2024)
LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World
par: Kim, Hojune, et autres
Publié: (2026)
par: Kim, Hojune, et autres
Publié: (2026)
MAkEable: Memory-centered and Affordance-based Task Execution Framework for Transferable Mobile Manipulation Skills
par: Pohl, Christoph, et autres
Publié: (2024)
par: Pohl, Christoph, et autres
Publié: (2024)
Safe, Task-Consistent Manipulation with Operational Space Control Barrier Functions
par: Morton, Daniel, et autres
Publié: (2025)
par: Morton, Daniel, et autres
Publié: (2025)
Task-Relevant and Irrelevant Region-Aware Augmentation for Generalizable Vision-Based Imitation Learning in Agricultural Manipulation
par: Hattori, Shun, et autres
Publié: (2026)
par: Hattori, Shun, et autres
Publié: (2026)
Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs
par: Niu, Jiahui, et autres
Publié: (2026)
par: Niu, Jiahui, et autres
Publié: (2026)
Prognostic Framework for Robotic Manipulators Operating Under Dynamic Task Severities
par: Mohanty, Ayush, et autres
Publié: (2024)
par: Mohanty, Ayush, et autres
Publié: (2024)
Documents similaires
-
ClevrSkills: Compositional Language and Visual Reasoning in Robotics
par: Haresh, Sanjay, et autres
Publié: (2024) -
Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models
par: Bendikas, Rokas, et autres
Publié: (2025) -
Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
par: Bhattacharyya, Apratim, et autres
Publié: (2025) -
Information-driven Affordance Discovery for Efficient Robotic Manipulation
par: Mazzaglia, Pietro, et autres
Publié: (2023) -
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
par: Xu, Siyu, et autres
Publié: (2025)