RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Mu, Yao, Chen, Junting, Zhang, Qinglong, Chen, Shoufa, Yu, Qiaojun, Ge, Chongjian, Chen, Runjian, Liang, Zhixuan, Hu, Mengkang, Tao, Chaofan, Sun, Peize, Yu, Haibao, Yang, Chao, Shao, Wenqi, Wang, Wenhai, Dai, Jifeng, Qiao, Yu, Ding, Mingyu, Luo, Ping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
por: Chen, Junting, et al.
Publicado: (2024)
por: Chen, Junting, et al.
Publicado: (2024)
PixelFlow: Pixel-Space Generative Models with Flow
por: Chen, Shoufa, et al.
Publicado: (2025)
por: Chen, Shoufa, et al.
Publicado: (2025)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
por: Chen, Junting, et al.
Publicado: (2025)
por: Chen, Junting, et al.
Publicado: (2025)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
por: Zhang, Shilong, et al.
Publicado: (2023)
por: Zhang, Shilong, et al.
Publicado: (2023)
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
por: Hu, Mengkang, et al.
Publicado: (2023)
por: Hu, Mengkang, et al.
Publicado: (2023)
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
por: Mu, Yao, et al.
Publicado: (2025)
por: Mu, Yao, et al.
Publicado: (2025)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
por: Hu, Mengkang, et al.
Publicado: (2024)
por: Hu, Mengkang, et al.
Publicado: (2024)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
por: Chen, Junting, et al.
Publicado: (2024)
por: Chen, Junting, et al.
Publicado: (2024)
Position: Towards Implicit Prompt For Text-To-Image Models
por: Yang, Yue, et al.
Publicado: (2024)
por: Yang, Yue, et al.
Publicado: (2024)
FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation
por: Zhang, Shilong, et al.
Publicado: (2025)
por: Zhang, Shilong, et al.
Publicado: (2025)
JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
por: Chen, Runjian, et al.
Publicado: (2025)
por: Chen, Runjian, et al.
Publicado: (2025)
TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
por: Chen, Runjian, et al.
Publicado: (2024)
por: Chen, Runjian, et al.
Publicado: (2024)
HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents
por: Liu, Yibin, et al.
Publicado: (2025)
por: Liu, Yibin, et al.
Publicado: (2025)
CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving
por: Chen, Runjian, et al.
Publicado: (2022)
por: Chen, Runjian, et al.
Publicado: (2022)
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
por: Sun, Peize, et al.
Publicado: (2024)
por: Sun, Peize, et al.
Publicado: (2024)
CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning
por: Chen, Runjian, et al.
Publicado: (2024)
por: Chen, Runjian, et al.
Publicado: (2024)
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation
por: Liang, Zhixuan, et al.
Publicado: (2024)
por: Liang, Zhixuan, et al.
Publicado: (2024)
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
ArtGS:3D Gaussian Splatting for Interactive Visual-Physical Modeling and Manipulation of Articulated Objects
por: Yu, Qiaojun, et al.
Publicado: (2025)
por: Yu, Qiaojun, et al.
Publicado: (2025)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
por: Hu, Mengkang, et al.
Publicado: (2025)
por: Hu, Mengkang, et al.
Publicado: (2025)
Towards A Generalist Code Embedding Model Based On Massive Data Synthesis
por: Li, Chaofan, et al.
Publicado: (2025)
por: Li, Chaofan, et al.
Publicado: (2025)
AnalogCoder: Analog Circuit Design via Training-Free Code Generation
por: Lai, Yao, et al.
Publicado: (2024)
por: Lai, Yao, et al.
Publicado: (2024)
SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations
por: Yan, Xiangchao, et al.
Publicado: (2023)
por: Yan, Xiangchao, et al.
Publicado: (2023)
DeCode: Decoupling Content and Delivery for Medical QA
por: Ko, Po-Jen, et al.
Publicado: (2026)
por: Ko, Po-Jen, et al.
Publicado: (2026)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023)
por: Chen, Zhe, et al.
Publicado: (2023)
Deep Variable-Length Feedback Codes
por: Ding, Yu, et al.
Publicado: (2026)
por: Ding, Yu, et al.
Publicado: (2026)
Deep Joint Source-Channel Coding for Wireless Video Transmission with Asymmetric Context
por: Chen, Xuechen, et al.
Publicado: (2026)
por: Chen, Xuechen, et al.
Publicado: (2026)
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
por: Chen, Tianxing, et al.
Publicado: (2025)
por: Chen, Tianxing, et al.
Publicado: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
por: Chen, Yuxuan, et al.
Publicado: (2026)
por: Chen, Yuxuan, et al.
Publicado: (2026)
GAMMA: Generalizable Articulation Modeling and Manipulation for Articulated Objects
por: Yu, Qiaojun, et al.
Publicado: (2023)
por: Yu, Qiaojun, et al.
Publicado: (2023)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
por: Fan, Lishui, et al.
Publicado: (2025)
por: Fan, Lishui, et al.
Publicado: (2025)
ControlAR: Controllable Image Generation with Autoregressive Models
por: Li, Zongming, et al.
Publicado: (2024)
por: Li, Zongming, et al.
Publicado: (2024)
Do Coding Agents Understand Least-Privilege Authorization?
por: Yan, Zheng, et al.
Publicado: (2026)
por: Yan, Zheng, et al.
Publicado: (2026)
Temporal Overlapping Prediction: A Self-supervised Pre-training Method for LiDAR Moving Object Segmentation
por: Miao, Ziliang, et al.
Publicado: (2025)
por: Miao, Ziliang, et al.
Publicado: (2025)
A Problem-Oriented Perspective and Anchor Verification for Code Optimization
por: Ye, Tong, et al.
Publicado: (2024)
por: Ye, Tong, et al.
Publicado: (2024)
DCP: Learning Accelerator Dataflow for Neural Network via Propagation
por: Xu, Peng, et al.
Publicado: (2024)
por: Xu, Peng, et al.
Publicado: (2024)
Structure-Aware Near-Field Radio Map Recovery via RBF-Assisted Matrix Completion
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
MIMO Beam Map Reconstruction via Toeplitz-Structured Matrix-Vector Tensor Decomposition
por: Sun, Hao, et al.
Publicado: (2026)
por: Sun, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
por: Chen, Junting, et al.
Publicado: (2024) -
PixelFlow: Pixel-Space Generative Models with Flow
por: Chen, Shoufa, et al.
Publicado: (2025) -
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
por: Chen, Junting, et al.
Publicado: (2025) -
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
por: Zhang, Shilong, et al.
Publicado: (2023) -
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
por: Hu, Mengkang, et al.
Publicado: (2023)