World Models with Hints of Large Language Models for Goal Achieving
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Zeyuan, Huan, Ziyu, Wang, Xiyao, Lyu, Jiafei, Tao, Jian, Li, Xiu, Huang, Furong, Xu, Huazhe |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mind the Model, Not the Agent: The Primacy Bias in Model-based RL
by: Qiao, Zhongjian, et al.
Published: (2023)
by: Qiao, Zhongjian, et al.
Published: (2023)
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
by: Liu, Zeyuan, et al.
Published: (2025)
by: Liu, Zeyuan, et al.
Published: (2025)
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
by: Zheng, Ruijie, et al.
Published: (2023)
by: Zheng, Ruijie, et al.
Published: (2023)
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation
by: Gong, Aicheng, et al.
Published: (2024)
by: Gong, Aicheng, et al.
Published: (2024)
Mildly Conservative Q-Learning for Offline Reinforcement Learning
by: Lyu, Jiafei, et al.
Published: (2022)
by: Lyu, Jiafei, et al.
Published: (2022)
Cross-Domain Policy Adaptation by Capturing Representation Mismatch
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive Loss
by: Zheng, Ruijie, et al.
Published: (2024)
by: Zheng, Ruijie, et al.
Published: (2024)
SEABO: A Simple Search-Based Method for Offline Imitation Learning
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
by: Yang, Kai, et al.
Published: (2023)
by: Yang, Kai, et al.
Published: (2023)
Self-Hinting Language Models Enhance Reinforcement Learning
by: Liao, Baohao, et al.
Published: (2026)
by: Liao, Baohao, et al.
Published: (2026)
Hints-In-Browser: Benchmarking Language Models for Programming Feedback Generation
by: Kotalwar, Nachiket, et al.
Published: (2024)
by: Kotalwar, Nachiket, et al.
Published: (2024)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
by: Sun, Shengjie, et al.
Published: (2025)
by: Sun, Shengjie, et al.
Published: (2025)
DR-Encoder: Encode Low-rank Gradients with Random Prior for Large Language Models Differentially Privately
by: Wu, Huiwen, et al.
Published: (2024)
by: Wu, Huiwen, et al.
Published: (2024)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
by: Xie, Yanyue, et al.
Published: (2024)
by: Xie, Yanyue, et al.
Published: (2024)
Agentic Critical Training
by: Liu, Weize, et al.
Published: (2026)
by: Liu, Weize, et al.
Published: (2026)
Evaluating the Goal-Directedness of Large Language Models
by: Everitt, Tom, et al.
Published: (2025)
by: Everitt, Tom, et al.
Published: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
by: Wang, Xiyao, et al.
Published: (2024)
by: Wang, Xiyao, et al.
Published: (2024)
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
by: Lei, Kun, et al.
Published: (2025)
by: Lei, Kun, et al.
Published: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
by: Wang, Xiyao, et al.
Published: (2024)
by: Wang, Xiyao, et al.
Published: (2024)
Skewed Memorization in Large Language Models: Quantification and Decomposition
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
Learning World Models for Unconstrained Goal Navigation
by: Duan, Yuanlin, et al.
Published: (2024)
by: Duan, Yuanlin, et al.
Published: (2024)
CG-FedLLM: How to Compress Gradients in Federated Fune-tuning for Large Language Models
by: Wu, Huiwen, et al.
Published: (2024)
by: Wu, Huiwen, et al.
Published: (2024)
APT: Architectural Planning and Text-to-Blueprint Construction Using Large Language Models for Open-World Agents
by: Chen, Jun Yu, et al.
Published: (2024)
by: Chen, Jun Yu, et al.
Published: (2024)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
by: Sehwag, Udari Madhushani, et al.
Published: (2025)
by: Sehwag, Udari Madhushani, et al.
Published: (2025)
Physics of Language Models: Part 1, Learning Hierarchical Language Structures
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
COPlanner: Plan to Roll Out Conservatively but to Explore Optimistically for Model-Based RL
by: Wang, Xiyao, et al.
Published: (2023)
by: Wang, Xiyao, et al.
Published: (2023)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
by: Ding, Mucong, et al.
Published: (2024)
by: Ding, Mucong, et al.
Published: (2024)
Revisiting Uncertainty Estimation and Calibration of Large Language Models
by: Tao, Linwei, et al.
Published: (2025)
by: Tao, Linwei, et al.
Published: (2025)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
Debiased Model-based Representations for Sample-efficient Continuous Control
by: Lyu, Jiafei, et al.
Published: (2026)
by: Lyu, Jiafei, et al.
Published: (2026)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
Collaborative Performance Prediction for Large Language Models
by: Zhang, Qiyuan, et al.
Published: (2024)
by: Zhang, Qiyuan, et al.
Published: (2024)
Physics of Language Models: Part 3.2, Knowledge Manipulation
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model
by: Yuan, Xiu, et al.
Published: (2024)
by: Yuan, Xiu, et al.
Published: (2024)
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
by: Pathmanathan, Pankayaraj, et al.
Published: (2026)
by: Pathmanathan, Pankayaraj, et al.
Published: (2026)
Physics of Language Models: Part 3.1, Knowledge Storage and Extraction
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
by: Allen-Zhu, Zeyuan, et al.
Published: (2023)
MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering
by: Ding, Chenlu, et al.
Published: (2025)
by: Ding, Chenlu, et al.
Published: (2025)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
by: Bhambri, Siddhant, et al.
Published: (2024)
by: Bhambri, Siddhant, et al.
Published: (2024)
Similar Items
-
Mind the Model, Not the Agent: The Primacy Bias in Model-based RL
by: Qiao, Zhongjian, et al.
Published: (2023) -
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
by: Liu, Zeyuan, et al.
Published: (2025) -
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
by: Zheng, Ruijie, et al.
Published: (2023) -
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
by: Lyu, Jiafei, et al.
Published: (2024) -
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation
by: Gong, Aicheng, et al.
Published: (2024)