MEM: Multi-Scale Embodied Memory for Vision Language Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Torne, Marcel, Pertsch, Karl, Walke, Homer, Vedder, Kyle, Nair, Suraj, Ichter, Brian, Ren, Allen Z., Wang, Haohuan, Tang, Jiaming, Stachowicz, Kyle, Dhabalia, Karan, Equi, Michael, Vuong, Quan, Springenberg, Jost Tobias, Levine, Sergey, Finn, Chelsea, Driess, Danny |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025)
par: Pertsch, Karl, et autres
Publié: (2025)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025)
par: Driess, Danny, et autres
Publié: (2025)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
par: Intelligence, Physical, et autres
Publié: (2025)
par: Intelligence, Physical, et autres
Publié: (2025)
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes
par: Stachowicz, Kyle, et autres
Publié: (2024)
par: Stachowicz, Kyle, et autres
Publié: (2024)
Training Strategies for Efficient Embodied Reasoning
par: Chen, William, et autres
Publié: (2025)
par: Chen, William, et autres
Publié: (2025)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
par: Black, Kevin, et autres
Publié: (2024)
par: Black, Kevin, et autres
Publié: (2024)
Robotic Control via Embodied Chain-of-Thought Reasoning
par: Zawalski, Michał, et autres
Publié: (2024)
par: Zawalski, Michał, et autres
Publié: (2024)
Toward Scalable, Flexible Scene Flow for Point Clouds
par: Vedder, Kyle
Publié: (2025)
par: Vedder, Kyle
Publié: (2025)
Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
par: Doshi, Ria, et autres
Publié: (2024)
par: Doshi, Ria, et autres
Publié: (2024)
Emergence of Human to Robot Transfer in Vision-Language-Action Models
par: Kareer, Simar, et autres
Publié: (2025)
par: Kareer, Simar, et autres
Publié: (2025)
Evaluating Real-World Robot Manipulation Policies in Simulation
par: Li, Xuanlin, et autres
Publié: (2024)
par: Li, Xuanlin, et autres
Publié: (2024)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
par: Xu, Charles, et autres
Publié: (2026)
par: Xu, Charles, et autres
Publié: (2026)
Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
par: Chen, William, et autres
Publié: (2026)
par: Chen, William, et autres
Publié: (2026)
$π^{*}_{0.6}$: a VLA That Learns From Experience
par: Intelligence, Physical, et autres
Publié: (2025)
par: Intelligence, Physical, et autres
Publié: (2025)
SELFI: Autonomous Self-Improvement with Reinforcement Learning for Social Navigation
par: Hirose, Noriaki, et autres
Publié: (2024)
par: Hirose, Noriaki, et autres
Publié: (2024)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
par: Qin, Chongli, et autres
Publié: (2025)
par: Qin, Chongli, et autres
Publié: (2025)
SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios
par: Gao, Tian, et autres
Publié: (2026)
par: Gao, Tian, et autres
Publié: (2026)
Learning Long-Context Diffusion Policies via Past-Token Prediction
par: Torne, Marcel, et autres
Publié: (2025)
par: Torne, Marcel, et autres
Publié: (2025)
Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding
par: Jones, Joshua, et autres
Publié: (2025)
par: Jones, Joshua, et autres
Publié: (2025)
Learning to Drive Anywhere with Model-Based Reannotation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
Autonomous Improvement of Instruction Following Skills via Foundation Models
par: Zhou, Zhiyuan, et autres
Publié: (2024)
par: Zhou, Zhiyuan, et autres
Publié: (2024)
BridgeData V2: A Dataset for Robot Learning at Scale
par: Walke, Homer, et autres
Publié: (2023)
par: Walke, Homer, et autres
Publié: (2023)
ALOHA Unleashed: A Simple Recipe for Robot Dexterity
par: Zhao, Tony Z., et autres
Publié: (2024)
par: Zhao, Tony Z., et autres
Publié: (2024)
KALIE: Fine-Tuning Vision-Language Models for Open-World Manipulation without Robot Data
par: Tang, Grace, et autres
Publié: (2024)
par: Tang, Grace, et autres
Publié: (2024)
Octo: An Open-Source Generalist Robot Policy
par: Octo Model Team, et autres
Publié: (2024)
par: Octo Model Team, et autres
Publié: (2024)
$π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
par: Intelligence, Physical, et autres
Publié: (2026)
par: Intelligence, Physical, et autres
Publié: (2026)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
par: Zheng, Chongyi, et autres
Publié: (2023)
par: Zheng, Chongyi, et autres
Publié: (2023)
Efficient Imitation Learning with Conservative World Models
par: Kolev, Victor, et autres
Publié: (2024)
par: Kolev, Victor, et autres
Publié: (2024)
Affordance-Guided Reinforcement Learning via Visual Prompting
par: Lee, Olivia Y., et autres
Publié: (2024)
par: Lee, Olivia Y., et autres
Publié: (2024)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
Yell At Your Robot: Improving On-the-Fly from Language Corrections
par: Shi, Lucy Xiaoyang, et autres
Publié: (2024)
par: Shi, Lucy Xiaoyang, et autres
Publié: (2024)
I Can't Believe It's Not Scene Flow!
par: Khatri, Ishan, et autres
Publié: (2024)
par: Khatri, Ishan, et autres
Publié: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
par: Chen, Boyuan, et autres
Publié: (2024)
par: Chen, Boyuan, et autres
Publié: (2024)
Tripod: Three Complementary Inductive Biases for Disentangled Representation Learning
par: Hsu, Kyle, et autres
Publié: (2024)
par: Hsu, Kyle, et autres
Publié: (2024)
Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation
par: Yang, Jonathan, et autres
Publié: (2024)
par: Yang, Jonathan, et autres
Publié: (2024)
PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies
par: Jain, Arhan, et autres
Publié: (2025)
par: Jain, Arhan, et autres
Publié: (2025)
Training-Time Action Conditioning for Efficient Real-Time Chunking
par: Black, Kevin, et autres
Publié: (2025)
par: Black, Kevin, et autres
Publié: (2025)
PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs
par: Nasiriany, Soroush, et autres
Publié: (2024)
par: Nasiriany, Soroush, et autres
Publié: (2024)
Documents similaires
-
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025) -
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025) -
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
par: Intelligence, Physical, et autres
Publié: (2025) -
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025) -
RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes
par: Stachowicz, Kyle, et autres
Publié: (2024)