Learning to Grasp Anything by Playing with Random Toys
Fuente:
arXiv
Guardado en:
| Autores principales: | Niu, Dantong, Sharma, Yuvan, Shi, Baifeng, Ding, Rachel, Gioia, Matteo, Xue, Haoru, Tsai, Henry, Kallidromitis, Konstantinos, Pai, Anirudh, Regan, Caitlin, Sastry, Shankar, Darrell, Trevor, Malik, Jitendra, Herzig, Roei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024)
por: Niu, Dantong, et al.
Publicado: (2024)
In-Context Learning Enables Robot Action Prediction in LLMs
por: Yin, Yida, et al.
Publicado: (2024)
por: Yin, Yida, et al.
Publicado: (2024)
Pre-training Auto-regressive Robotic Models with 4D Representations
por: Niu, Dantong, et al.
Publicado: (2025)
por: Niu, Dantong, et al.
Publicado: (2025)
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023)
por: Ge, Jiaxin, et al.
Publicado: (2023)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025)
por: Mitra, Chancharik, et al.
Publicado: (2025)
Do What? Teaching Vision-Language-Action Models to Reject the Impossible
por: Hsieh, Wen-Han, et al.
Publicado: (2025)
por: Hsieh, Wen-Han, et al.
Publicado: (2025)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
From Generated Human Videos to Physically Plausible Robot Trajectories
por: Ni, James, et al.
Publicado: (2025)
por: Ni, James, et al.
Publicado: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
por: Shang, Chuyi, et al.
Publicado: (2024)
por: Shang, Chuyi, et al.
Publicado: (2024)
LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction
por: Xue, Haoru, et al.
Publicado: (2025)
por: Xue, Haoru, et al.
Publicado: (2025)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
por: Huang, Brandon, et al.
Publicado: (2025)
por: Huang, Brandon, et al.
Publicado: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024)
por: Huang, Brandon, et al.
Publicado: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
Latent Implicit Visual Reasoning
por: Li, Kelvin, et al.
Publicado: (2025)
por: Li, Kelvin, et al.
Publicado: (2025)
Humanoid Locomotion as Next Token Prediction
por: Radosavovic, Ilija, et al.
Publicado: (2024)
por: Radosavovic, Ilija, et al.
Publicado: (2024)
Learning Humanoid Locomotion over Challenging Terrain
por: Radosavovic, Ilija, et al.
Publicado: (2024)
por: Radosavovic, Ilija, et al.
Publicado: (2024)
Segment Anything without Supervision
por: Wang, XuDong, et al.
Publicado: (2024)
por: Wang, XuDong, et al.
Publicado: (2024)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
por: Qin, Yiming, et al.
Publicado: (2025)
por: Qin, Yiming, et al.
Publicado: (2025)
Hyperbolic Active Learning for Semantic Segmentation under Domain Shift
por: Franco, Luca, et al.
Publicado: (2023)
por: Franco, Luca, et al.
Publicado: (2023)
LLM-grounded Video Diffusion Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
When Do We Not Need Larger Vision Models?
por: Shi, Baifeng, et al.
Publicado: (2024)
por: Shi, Baifeng, et al.
Publicado: (2024)
Toy Libraries: Learning through Play with Toys.
por: Kapellaka, Urania
Publicado: (1992)
por: Kapellaka, Urania
Publicado: (1992)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025)
por: Gan, Yulu, et al.
Publicado: (2025)
Independent and Decentralized Learning in Markov Potential Games
por: Maheshwari, Chinmay, et al.
Publicado: (2022)
por: Maheshwari, Chinmay, et al.
Publicado: (2022)
SegLLM: Multi-round Reasoning Segmentation
por: Wang, XuDong, et al.
Publicado: (2024)
por: Wang, XuDong, et al.
Publicado: (2024)
xT: Nested Tokenization for Larger Context in Large Images
por: Gupta, Ritwik, et al.
Publicado: (2024)
por: Gupta, Ritwik, et al.
Publicado: (2024)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
por: Yu, Junwei, et al.
Publicado: (2025)
por: Yu, Junwei, et al.
Publicado: (2025)
Toy Libraries: Promoting Play, Toys, and Family Support Internationally.
por: Mayfield, Margie I.
Publicado: (1993)
por: Mayfield, Margie I.
Publicado: (1993)
Bibliography of Children's Play and Toys.
por: Quilitch, H. Robert
Publicado: (1974)
por: Quilitch, H. Robert
Publicado: (1974)
Whole-Body Conditioned Egocentric Video Prediction
por: Bai, Yutong, et al.
Publicado: (2025)
por: Bai, Yutong, et al.
Publicado: (2025)
Cellular Learning: Scattered Data Regression in High Dimensions via Voronoi Cells
por: Sastry, Shankar Prasad
Publicado: (2025)
por: Sastry, Shankar Prasad
Publicado: (2025)
Play and Learn with Toys; A Bibliography of Toys that "Teach Institutionalized Children".
Publicado: (1976)
Publicado: (1976)
TULIP: Towards Unified Language-Image Pretraining
por: Tang, Zineng, et al.
Publicado: (2025)
por: Tang, Zineng, et al.
Publicado: (2025)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
por: Mitra, Chancharik, et al.
Publicado: (2024)
por: Mitra, Chancharik, et al.
Publicado: (2024)
HITTER: A HumanoId Table TEnnis Robot via Hierarchical Planning and Learning
por: Su, Zhi, et al.
Publicado: (2025)
por: Su, Zhi, et al.
Publicado: (2025)
Evaluación del comportamiento productivo en cerdos en crecimiento alimentados con una dieta no convencional
por: Yuván Contino-Esquijerosa
Publicado: (2017)
por: Yuván Contino-Esquijerosa
Publicado: (2017)
Adopción de nuevas prácticas agroecológicas en tres unidades básicas de producción cooperativa
por: Yuván Contino Esquijerosa
Publicado: (2018)
por: Yuván Contino Esquijerosa
Publicado: (2018)
Play for All Children: The Toy Library Solution.
por: Jackson, Sara C, et al.
Publicado: (1991)
por: Jackson, Sara C, et al.
Publicado: (1991)
Activation Reward Models for Few-Shot Model Alignment
por: Chai, Tianning, et al.
Publicado: (2025)
por: Chai, Tianning, et al.
Publicado: (2025)
Ejemplares similares
-
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024) -
In-Context Learning Enables Robot Action Prediction in LLMs
por: Yin, Yida, et al.
Publicado: (2024) -
Pre-training Auto-regressive Robotic Models with 4D Representations
por: Niu, Dantong, et al.
Publicado: (2025) -
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023) -
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025)