Language-Model-Assisted Bi-Level Programming for Reward Learning from Internet Videos
Fuente:
arXiv
Saved in:
| Main Authors: | Mahesheka, Harsh, Xie, Zhixian, Wang, Zhaoran, Jin, Wanxin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Whole-Body Teleoperation for Mobile Manipulation at Zero Added Cost
by: Honerkamp, Daniel, et al.
Published: (2024)
by: Honerkamp, Daniel, et al.
Published: (2024)
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
by: Wang, Meizhong, et al.
Published: (2026)
by: Wang, Meizhong, et al.
Published: (2026)
Safe MPC Alignment with Human Directional Feedback
by: Xie, Zhixian, et al.
Published: (2024)
by: Xie, Zhixian, et al.
Published: (2024)
Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models
by: Wu, Yanru, et al.
Published: (2026)
by: Wu, Yanru, et al.
Published: (2026)
RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupted Human Feedback
by: Vatsa, Amitesh, et al.
Published: (2026)
by: Vatsa, Amitesh, et al.
Published: (2026)
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning
by: Chen, Yuhui, et al.
Published: (2025)
by: Chen, Yuhui, et al.
Published: (2025)
Eureka: Human-Level Reward Design via Coding Large Language Models
by: Ma, Yecheng Jason, et al.
Published: (2023)
by: Ma, Yecheng Jason, et al.
Published: (2023)
KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition
by: Han, Gaoge, et al.
Published: (2026)
by: Han, Gaoge, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models
by: Wu, Hao, et al.
Published: (2026)
by: Wu, Hao, et al.
Published: (2026)
Learning Reward for Robot Skills Using Large Language Models via Self-Alignment
by: Zeng, Yuwei, et al.
Published: (2024)
by: Zeng, Yuwei, et al.
Published: (2024)
Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning
by: Huang, Changxin, et al.
Published: (2025)
by: Huang, Changxin, et al.
Published: (2025)
EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards
by: Wang, Ruixiang, et al.
Published: (2026)
by: Wang, Ruixiang, et al.
Published: (2026)
Reward Training Wheels: Adaptive Auxiliary Rewards for Robotics Reinforcement Learning
by: Wang, Linji, et al.
Published: (2025)
by: Wang, Linji, et al.
Published: (2025)
RobotKeyframing: Learning Locomotion with High-Level Objectives via Mixture of Dense and Sparse Rewards
by: Zargarbashi, Fatemeh, et al.
Published: (2024)
by: Zargarbashi, Fatemeh, et al.
Published: (2024)
Where to Touch, How to Contact: Hierarchical RL-MPC Framework for Geometry-Aware Long-Horizon Dexterous Manipulation
by: Xie, Zhixian, et al.
Published: (2026)
by: Xie, Zhixian, et al.
Published: (2026)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
by: Liu, Yuyang, et al.
Published: (2025)
by: Liu, Yuyang, et al.
Published: (2025)
Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following
by: Yang, Yuxiao, et al.
Published: (2024)
by: Yang, Yuxiao, et al.
Published: (2024)
MALMM: Multi-Agent Large Language Models for Zero-Shot Robotics Manipulation
by: Singh, Harsh, et al.
Published: (2024)
by: Singh, Harsh, et al.
Published: (2024)
Open-World Drone Active Tracking with Goal-Centered Rewards
by: Sun, Haowei, et al.
Published: (2024)
by: Sun, Haowei, et al.
Published: (2024)
ComFree-Sim: A GPU-Parallelized Analytical Contact Physics Engine for Scalable Contact-Rich Robotics Simulation and Control
by: Borse, Chetan, et al.
Published: (2026)
by: Borse, Chetan, et al.
Published: (2026)
Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems
by: Ji, Jiabao, et al.
Published: (2026)
by: Ji, Jiabao, et al.
Published: (2026)
EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models
by: Zhao, Zhikai, et al.
Published: (2026)
by: Zhao, Zhikai, et al.
Published: (2026)
Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language
by: Hwang, Minyoung, et al.
Published: (2025)
by: Hwang, Minyoung, et al.
Published: (2025)
Developing Vision-Language-Action Model from Egocentric Videos
by: Yoshida, Tomoya, et al.
Published: (2025)
by: Yoshida, Tomoya, et al.
Published: (2025)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
by: Hung, Chia-Yu, et al.
Published: (2025)
by: Hung, Chia-Yu, et al.
Published: (2025)
Residual Reward Models for Preference-based Reinforcement Learning
by: Cao, Chenyang, et al.
Published: (2025)
by: Cao, Chenyang, et al.
Published: (2025)
SuPLE: Robot Learning with Lyapunov Rewards
by: Nguyen, Phu, et al.
Published: (2024)
by: Nguyen, Phu, et al.
Published: (2024)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
by: Deng, Boyuan, et al.
Published: (2025)
by: Deng, Boyuan, et al.
Published: (2025)
ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation
by: Zhao, Enyu, et al.
Published: (2025)
by: Zhao, Enyu, et al.
Published: (2025)
Bi-LAT: Bilateral Control-Based Imitation Learning via Natural Language and Action Chunking with Transformers
by: Kobayashi, Takumi, et al.
Published: (2025)
by: Kobayashi, Takumi, et al.
Published: (2025)
Planning with Vision-Language Models and a Use Case in Robot-Assisted Teaching
by: Dang, Xuzhe, et al.
Published: (2025)
by: Dang, Xuzhe, et al.
Published: (2025)
A Learning-based Adaptive Compliance Method for Symmetric Bi-manual Manipulation
by: Cao, Yuxue, et al.
Published: (2023)
by: Cao, Yuxue, et al.
Published: (2023)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
by: Yang, Rushuai, et al.
Published: (2026)
by: Yang, Rushuai, et al.
Published: (2026)
Diffusion-Reward Adversarial Imitation Learning
by: Lai, Chun-Mao, et al.
Published: (2024)
by: Lai, Chun-Mao, et al.
Published: (2024)
Reward-Punishment Reinforcement Learning with Maximum Entropy
by: Wang, Jiexin, et al.
Published: (2024)
by: Wang, Jiexin, et al.
Published: (2024)
Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models
by: Wang, Chen, et al.
Published: (2025)
by: Wang, Chen, et al.
Published: (2025)
ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
by: Lv, Jindi, et al.
Published: (2026)
by: Lv, Jindi, et al.
Published: (2026)
Learning Skills from Action-Free Videos
by: Fang, Hung-Chieh, et al.
Published: (2025)
by: Fang, Hung-Chieh, et al.
Published: (2025)
Similar Items
-
Whole-Body Teleoperation for Mobile Manipulation at Zero Added Cost
by: Honerkamp, Daniel, et al.
Published: (2024) -
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
by: Wang, Meizhong, et al.
Published: (2026) -
Safe MPC Alignment with Human Directional Feedback
by: Xie, Zhixian, et al.
Published: (2024) -
Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models
by: Wu, Yanru, et al.
Published: (2026) -
RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupted Human Feedback
by: Vatsa, Amitesh, et al.
Published: (2026)