RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mu, Yao, Chen, Junting, Zhang, Qinglong, Chen, Shoufa, Yu, Qiaojun, Ge, Chongjian, Chen, Runjian, Liang, Zhixuan, Hu, Mengkang, Tao, Chaofan, Sun, Peize, Yu, Haibao, Yang, Chao, Shao, Wenqi, Wang, Wenhai, Dai, Jifeng, Qiao, Yu, Ding, Mingyu, Luo, Ping |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
par: Chen, Junting, et autres
Publié: (2024)
par: Chen, Junting, et autres
Publié: (2024)
PixelFlow: Pixel-Space Generative Models with Flow
par: Chen, Shoufa, et autres
Publié: (2025)
par: Chen, Shoufa, et autres
Publié: (2025)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
par: Chen, Junting, et autres
Publié: (2025)
par: Chen, Junting, et autres
Publié: (2025)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
par: Zhang, Shilong, et autres
Publié: (2023)
par: Zhang, Shilong, et autres
Publié: (2023)
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
par: Hu, Mengkang, et autres
Publié: (2023)
par: Hu, Mengkang, et autres
Publié: (2023)
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
par: Mu, Yao, et autres
Publié: (2025)
par: Mu, Yao, et autres
Publié: (2025)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
par: Hu, Mengkang, et autres
Publié: (2024)
par: Hu, Mengkang, et autres
Publié: (2024)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
par: Chen, Junting, et autres
Publié: (2024)
par: Chen, Junting, et autres
Publié: (2024)
Position: Towards Implicit Prompt For Text-To-Image Models
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation
par: Zhang, Shilong, et autres
Publié: (2025)
par: Zhang, Shilong, et autres
Publié: (2025)
JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
par: Chen, Runjian, et autres
Publié: (2025)
par: Chen, Runjian, et autres
Publié: (2025)
TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
par: Chen, Runjian, et autres
Publié: (2024)
par: Chen, Runjian, et autres
Publié: (2024)
HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents
par: Liu, Yibin, et autres
Publié: (2025)
par: Liu, Yibin, et autres
Publié: (2025)
CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving
par: Chen, Runjian, et autres
Publié: (2022)
par: Chen, Runjian, et autres
Publié: (2022)
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
par: Sun, Peize, et autres
Publié: (2024)
par: Sun, Peize, et autres
Publié: (2024)
CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning
par: Chen, Runjian, et autres
Publié: (2024)
par: Chen, Runjian, et autres
Publié: (2024)
Needle In A Multimodal Haystack
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation
par: Liang, Zhixuan, et autres
Publié: (2024)
par: Liang, Zhixuan, et autres
Publié: (2024)
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
ArtGS:3D Gaussian Splatting for Interactive Visual-Physical Modeling and Manipulation of Articulated Objects
par: Yu, Qiaojun, et autres
Publié: (2025)
par: Yu, Qiaojun, et autres
Publié: (2025)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
par: Hu, Mengkang, et autres
Publié: (2025)
par: Hu, Mengkang, et autres
Publié: (2025)
Towards A Generalist Code Embedding Model Based On Massive Data Synthesis
par: Li, Chaofan, et autres
Publié: (2025)
par: Li, Chaofan, et autres
Publié: (2025)
AnalogCoder: Analog Circuit Design via Training-Free Code Generation
par: Lai, Yao, et autres
Publié: (2024)
par: Lai, Yao, et autres
Publié: (2024)
SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations
par: Yan, Xiangchao, et autres
Publié: (2023)
par: Yan, Xiangchao, et autres
Publié: (2023)
DeCode: Decoupling Content and Delivery for Medical QA
par: Ko, Po-Jen, et autres
Publié: (2026)
par: Ko, Po-Jen, et autres
Publié: (2026)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
par: Chen, Zhe, et autres
Publié: (2023)
par: Chen, Zhe, et autres
Publié: (2023)
Deep Variable-Length Feedback Codes
par: Ding, Yu, et autres
Publié: (2026)
par: Ding, Yu, et autres
Publié: (2026)
Deep Joint Source-Channel Coding for Wireless Video Transmission with Asymmetric Context
par: Chen, Xuechen, et autres
Publié: (2026)
par: Chen, Xuechen, et autres
Publié: (2026)
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
par: Chen, Tianxing, et autres
Publié: (2025)
par: Chen, Tianxing, et autres
Publié: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
par: Chen, Yuxuan, et autres
Publié: (2026)
par: Chen, Yuxuan, et autres
Publié: (2026)
GAMMA: Generalizable Articulation Modeling and Manipulation for Articulated Objects
par: Yu, Qiaojun, et autres
Publié: (2023)
par: Yu, Qiaojun, et autres
Publié: (2023)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
par: Fan, Lishui, et autres
Publié: (2025)
par: Fan, Lishui, et autres
Publié: (2025)
ControlAR: Controllable Image Generation with Autoregressive Models
par: Li, Zongming, et autres
Publié: (2024)
par: Li, Zongming, et autres
Publié: (2024)
Do Coding Agents Understand Least-Privilege Authorization?
par: Yan, Zheng, et autres
Publié: (2026)
par: Yan, Zheng, et autres
Publié: (2026)
Temporal Overlapping Prediction: A Self-supervised Pre-training Method for LiDAR Moving Object Segmentation
par: Miao, Ziliang, et autres
Publié: (2025)
par: Miao, Ziliang, et autres
Publié: (2025)
A Problem-Oriented Perspective and Anchor Verification for Code Optimization
par: Ye, Tong, et autres
Publié: (2024)
par: Ye, Tong, et autres
Publié: (2024)
DCP: Learning Accelerator Dataflow for Neural Network via Propagation
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
Structure-Aware Near-Field Radio Map Recovery via RBF-Assisted Matrix Completion
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
MIMO Beam Map Reconstruction via Toeplitz-Structured Matrix-Vector Tensor Decomposition
par: Sun, Hao, et autres
Publié: (2026)
par: Sun, Hao, et autres
Publié: (2026)
Documents similaires
-
RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
par: Chen, Junting, et autres
Publié: (2024) -
PixelFlow: Pixel-Space Generative Models with Flow
par: Chen, Shoufa, et autres
Publié: (2025) -
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
par: Chen, Junting, et autres
Publié: (2025) -
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
par: Zhang, Shilong, et autres
Publié: (2023) -
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
par: Hu, Mengkang, et autres
Publié: (2023)