RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Junting, Mu, Yao, Yu, Qiaojun, Wei, Tianming, Wu, Silang, Yuan, Zhecheng, Liang, Zhixuan, Yang, Chao, Zhang, Kaipeng, Shao, Wenqi, Qiao, Yu, Xu, Huazhe, Ding, Mingyu, Luo, Ping |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
par: Chen, Junting, et autres
Publié: (2025)
par: Chen, Junting, et autres
Publié: (2025)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
par: Chen, Junting, et autres
Publié: (2024)
par: Chen, Junting, et autres
Publié: (2024)
Learning the meanings of function words from grounded language using a visual question answering model
par: Portelance, Eva, et autres
Publié: (2023)
par: Portelance, Eva, et autres
Publié: (2023)
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)
par: Yang, Shan
Publié: (2026)
Spatially-Aware Speaker for Vision-and-Language Navigation Instruction Generation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos
par: Hu, X., et autres
Publié: (2025)
par: Hu, X., et autres
Publié: (2025)
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
U-Net-Like Spiking Neural Networks for Single Image Dehazing
par: Li, Huibin, et autres
Publié: (2025)
par: Li, Huibin, et autres
Publié: (2025)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
par: Dai, Song, et autres
Publié: (2025)
par: Dai, Song, et autres
Publié: (2025)
ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment
par: Bian, Zhipeng, et autres
Publié: (2026)
par: Bian, Zhipeng, et autres
Publié: (2026)
eStonefish-Scenes: A Sim-to-Real Validated and Robot-Centric Event-based Optical Flow Dataset for Underwater Vehicles
par: Mansour, Jad, et autres
Publié: (2025)
par: Mansour, Jad, et autres
Publié: (2025)
eCARLA-scenes: A synthetically generated dataset for event-based optical flow prediction
par: Mansour, Jad, et autres
Publié: (2024)
par: Mansour, Jad, et autres
Publié: (2024)
Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
par: Seo, Huichan, et autres
Publié: (2025)
par: Seo, Huichan, et autres
Publié: (2025)
Evaluating the Impact of Synthetic Data on Object Detection Tasks in Autonomous Driving
par: Özeren, Enes, et autres
Publié: (2025)
par: Özeren, Enes, et autres
Publié: (2025)
CCVA-FL: Cross-Client Variations Adaptive Federated Learning for Medical Imaging
par: Gupta, Sunny, et autres
Publié: (2024)
par: Gupta, Sunny, et autres
Publié: (2024)
Taming the Tail: Leveraging Asymmetric Loss and Pade Approximation to Overcome Medical Image Long-Tailed Class Imbalance
par: Kashyap, Pankhi, et autres
Publié: (2024)
par: Kashyap, Pankhi, et autres
Publié: (2024)
Reframing linguistic bootstrapping as joint inference using visually-grounded grammar induction models
par: Portelance, Eva, et autres
Publié: (2024)
par: Portelance, Eva, et autres
Publié: (2024)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)
par: Oliveira, Daniel, et autres
Publié: (2026)
RoboMoRe: LLM-based Robot Co-design via Joint Optimization of Morphology and Reward
par: Fang, Jiawei, et autres
Publié: (2025)
par: Fang, Jiawei, et autres
Publié: (2025)
RoboPack: Learning Tactile-Informed Dynamics Models for Dense Packing
par: Ai, Bo, et autres
Publié: (2024)
par: Ai, Bo, et autres
Publié: (2024)
PC-SNN: Predictive Coding-based Local Hebbian Plasticity Learning in Spiking Neural Networks
par: Wang, Haidong, et autres
Publié: (2022)
par: Wang, Haidong, et autres
Publié: (2022)
SUN Team's Contribution to ABAW 2024 Competition: Audio-visual Valence-Arousal Estimation and Expression Recognition
par: Dresvyanskiy, Denis, et autres
Publié: (2024)
par: Dresvyanskiy, Denis, et autres
Publié: (2024)
Industrial Robot Motion Planning with GPUs: Integration of cuRobo for Extended DOF Systems
par: Abuelsamen, Luai, et autres
Publié: (2025)
par: Abuelsamen, Luai, et autres
Publié: (2025)
Task Singular Vectors: Reducing Task Interference in Model Merging
par: Gargiulo, Antonio Andrea, et autres
Publié: (2024)
par: Gargiulo, Antonio Andrea, et autres
Publié: (2024)
OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping
par: Li, Danyang, et autres
Publié: (2025)
par: Li, Danyang, et autres
Publié: (2025)
Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight
par: Romero, Angel, et autres
Publié: (2025)
par: Romero, Angel, et autres
Publié: (2025)
WayFASTER: a Self-Supervised Traversability Prediction for Increased Navigation Awareness
par: Gasparino, Mateus Valverde, et autres
Publié: (2024)
par: Gasparino, Mateus Valverde, et autres
Publié: (2024)
EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents
par: Riva, Paolo, et autres
Publié: (2026)
par: Riva, Paolo, et autres
Publié: (2026)
Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent
par: Lim, Shoon Kit, et autres
Publié: (2025)
par: Lim, Shoon Kit, et autres
Publié: (2025)
StratXplore: Strategic Novelty-seeking and Instruction-aligned Exploration for Vision and Language Navigation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
Deep Probabilistic Traversability with Test-time Adaptation for Uncertainty-aware Planetary Rover Navigation
par: Endo, Masafumi, et autres
Publié: (2024)
par: Endo, Masafumi, et autres
Publié: (2024)
CoMoCAVs: Cohesive Decision-Guided Motion Planning for Connected and Autonomous Vehicles with Multi-Policy Reinforcement Learning
par: Hu, Pan
Publié: (2025)
par: Hu, Pan
Publié: (2025)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
Spot-Compose: A Framework for Open-Vocabulary Object Retrieval and Drawer Manipulation in Point Clouds
par: Lemke, Oliver, et autres
Publié: (2024)
par: Lemke, Oliver, et autres
Publié: (2024)
Contextual Graph Representations for Task-Driven 3D Perception and Planning
par: Agia, Christopher
Publié: (2026)
par: Agia, Christopher
Publié: (2026)
YETI (YET to Intervene) Proactive Interventions by Multimodal AI Agents in Augmented Reality Tasks
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
Pan-Arctic Permafrost Landform and Human-built Infrastructure Feature Detection with Vision Transformers and Location Embeddings
par: Perera, Amal S., et autres
Publié: (2025)
par: Perera, Amal S., et autres
Publié: (2025)
T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models
par: Chen, Yiteng, et autres
Publié: (2025)
par: Chen, Yiteng, et autres
Publié: (2025)
Ultra-Reduced-Impact-Encased-Logging (URIEL): propose a new method for selective sustainable logging and post-harvest silvicultural treatment in tropical forest using airborne robotics systems
par: Albiero, Daniel, et autres
Publié: (2026)
par: Albiero, Daniel, et autres
Publié: (2026)
Documents similaires
-
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
par: Chen, Junting, et autres
Publié: (2025) -
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025) -
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
par: Chen, Junting, et autres
Publié: (2024) -
Learning the meanings of function words from grounded language using a visual question answering model
par: Portelance, Eva, et autres
Publié: (2023) -
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)