Aligning Agents like Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jelley, Adam, Cao, Yuhan, Bignell, Dave, Storkey, Amos, Devlin, Sam, Rashid, Tabish |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Laws for Pre-training Agents and World Models
par: Pearce, Tim, et autres
Publié: (2024)
par: Pearce, Tim, et autres
Publié: (2024)
Efficient Offline Reinforcement Learning: First Imitate, then Improve
par: Jelley, Adam, et autres
Publié: (2024)
par: Jelley, Adam, et autres
Publié: (2024)
Adapting Vision-Language Models for Evaluating World Models
par: Hendriksen, Mariya, et autres
Publié: (2025)
par: Hendriksen, Mariya, et autres
Publié: (2025)
Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games
par: Schäfer, Lukas, et autres
Publié: (2023)
par: Schäfer, Lukas, et autres
Publié: (2023)
Diffusion for World Modeling: Visual Details Matter in Atari
par: Alonso, Eloi, et autres
Publié: (2024)
par: Alonso, Eloi, et autres
Publié: (2024)
Adversarial robustness of VAEs through the lens of local geometry
par: Khan, Asif, et autres
Publié: (2022)
par: Khan, Asif, et autres
Publié: (2022)
LLM-Personalize: Aligning LLM Planners with Human Preferences via Reinforced Self-Training for Housekeeping Robots
par: Han, Dongge, et autres
Publié: (2024)
par: Han, Dongge, et autres
Publié: (2024)
Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning
par: McInroe, Trevor, et autres
Publié: (2023)
par: McInroe, Trevor, et autres
Publié: (2023)
HyperMARL: Adaptive Hypernetworks for Multi-Agent RL
par: Tessera, Kale-ab Abebe, et autres
Publié: (2024)
par: Tessera, Kale-ab Abebe, et autres
Publié: (2024)
Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning
par: Zhang, Weipu, et autres
Publié: (2025)
par: Zhang, Weipu, et autres
Publié: (2025)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
par: Gupta, Akash, et autres
Publié: (2025)
par: Gupta, Akash, et autres
Publié: (2025)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
par: Kabir, Muhammad Rafsan, et autres
Publié: (2024)
par: Kabir, Muhammad Rafsan, et autres
Publié: (2024)
Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report
par: Mereu, Riccardo, et autres
Publié: (2025)
par: Mereu, Riccardo, et autres
Publié: (2025)
Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback
par: Zheng, Qinqing, et autres
Publié: (2024)
par: Zheng, Qinqing, et autres
Publié: (2024)
Align to Structure: Aligning Large Language Models with Structural Information
par: Kim, Zae Myung, et autres
Publié: (2025)
par: Kim, Zae Myung, et autres
Publié: (2025)
Provable Benefits of In-Tool Learning for Large Language Models
par: Houliston, Sam, et autres
Publié: (2025)
par: Houliston, Sam, et autres
Publié: (2025)
Human-like Working Memory Interference in Large Language Models
par: Xiong, Hua-Dong, et autres
Publié: (2026)
par: Xiong, Hua-Dong, et autres
Publié: (2026)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
par: Yang, Zhicheng, et autres
Publié: (2023)
par: Yang, Zhicheng, et autres
Publié: (2023)
Structure-Aligned Protein Language Model
par: Chen, Can, et autres
Publié: (2025)
par: Chen, Can, et autres
Publié: (2025)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
par: Nguyen, Thanh Thi, et autres
Publié: (2025)
par: Nguyen, Thanh Thi, et autres
Publié: (2025)
GUNDAM: Aligning Large Language Models with Graph Understanding
par: Ouyang, Sheng, et autres
Publié: (2024)
par: Ouyang, Sheng, et autres
Publié: (2024)
Aligning Large Language Models by On-Policy Self-Judgment
par: Lee, Sangkyu, et autres
Publié: (2024)
par: Lee, Sangkyu, et autres
Publié: (2024)
Rationality Measurement and Theory for Reinforcement Learning Agents
par: Qian, Kejiang, et autres
Publié: (2026)
par: Qian, Kejiang, et autres
Publié: (2026)
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
par: Xiao, Jiancong, et autres
Publié: (2025)
par: Xiao, Jiancong, et autres
Publié: (2025)
Large Language Model Agent for Hyper-Parameter Optimization
par: Liu, Siyi, et autres
Publié: (2024)
par: Liu, Siyi, et autres
Publié: (2024)
Toward Efficient Exploration by Large Language Model Agents
par: Arumugam, Dilip, et autres
Publié: (2025)
par: Arumugam, Dilip, et autres
Publié: (2025)
Aligning Large Language Models via Fine-grained Supervision
par: Xu, Dehong, et autres
Publié: (2024)
par: Xu, Dehong, et autres
Publié: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Efficiently Aligning Language Models with Online Natural Language Feedback
par: Ye, Christine, et autres
Publié: (2026)
par: Ye, Christine, et autres
Publié: (2026)
Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach
par: Lu, Wei, et autres
Publié: (2025)
par: Lu, Wei, et autres
Publié: (2025)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
par: Kang, Yuhan, et autres
Publié: (2025)
par: Kang, Yuhan, et autres
Publié: (2025)
Understanding Post-Training Structural Changes in Large Language Models
par: He, Xinyu, et autres
Publié: (2025)
par: He, Xinyu, et autres
Publié: (2025)
On amortizing convex conjugates for optimal transport
par: Amos, Brandon
Publié: (2022)
par: Amos, Brandon
Publié: (2022)
Creating Artificial Students that Never Existed: Leveraging Large Language Models and CTGANs for Synthetic Data Generation
par: Khalil, Mohammad, et autres
Publié: (2025)
par: Khalil, Mohammad, et autres
Publié: (2025)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
par: Sharma, Archit, et autres
Publié: (2024)
par: Sharma, Archit, et autres
Publié: (2024)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
Aligning Large Language Models with Representation Editing: A Control Perspective
par: Kong, Lingkai, et autres
Publié: (2024)
par: Kong, Lingkai, et autres
Publié: (2024)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models
par: Wu, Zhanglin, et autres
Publié: (2025)
par: Wu, Zhanglin, et autres
Publié: (2025)
Approximate Bayesian Class-Conditional Models under Continuous Representation Shift
par: Lee, Thomas L., et autres
Publié: (2023)
par: Lee, Thomas L., et autres
Publié: (2023)
Documents similaires
-
Scaling Laws for Pre-training Agents and World Models
par: Pearce, Tim, et autres
Publié: (2024) -
Efficient Offline Reinforcement Learning: First Imitate, then Improve
par: Jelley, Adam, et autres
Publié: (2024) -
Adapting Vision-Language Models for Evaluating World Models
par: Hendriksen, Mariya, et autres
Publié: (2025) -
Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games
par: Schäfer, Lukas, et autres
Publié: (2023) -
Diffusion for World Modeling: Visual Details Matter in Atari
par: Alonso, Eloi, et autres
Publié: (2024)