Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Author: | Mo, Shentong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
by: Sun, Chuanneng, et al.
Published: (2024)
by: Sun, Chuanneng, et al.
Published: (2024)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
by: Kapoor, Aditya, et al.
Published: (2025)
by: Kapoor, Aditya, et al.
Published: (2025)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
by: Kong, Lingxiao, et al.
Published: (2025)
by: Kong, Lingxiao, et al.
Published: (2025)
MinionsLLM: a Task-adaptive Framework For The Training and Control of Multi-Agent Systems Through Natural Language
by: Rincon, Andres Garcia, et al.
Published: (2025)
by: Rincon, Andres Garcia, et al.
Published: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
by: Mo, Shentong, et al.
Published: (2026)
by: Mo, Shentong, et al.
Published: (2026)
Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration
by: Zhang, Yang, et al.
Published: (2024)
by: Zhang, Yang, et al.
Published: (2024)
Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
by: Andrade, Moises, et al.
Published: (2025)
by: Andrade, Moises, et al.
Published: (2025)
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
by: Sarkar, Bidipta, et al.
Published: (2025)
by: Sarkar, Bidipta, et al.
Published: (2025)
Compositional Coordination for Multi-Robot Teams with Large Language Models
by: Huang, Zhehui, et al.
Published: (2025)
by: Huang, Zhehui, et al.
Published: (2025)
Innate-Values-driven Reinforcement Learning based Cooperative Multi-Agent Cognitive Modeling
by: Yang, Qin
Published: (2024)
by: Yang, Qin
Published: (2024)
TwoStep: Multi-agent Task Planning using Classical Planners and Large Language Models
by: Bai, David, et al.
Published: (2024)
by: Bai, David, et al.
Published: (2024)
Deep Reinforcement Learning for Multi-Agent Coordination
by: Aina, Kehinde O., et al.
Published: (2025)
by: Aina, Kehinde O., et al.
Published: (2025)
Exploring Natural Language-Based Strategies for Efficient Number Learning in Children through Reinforcement Learning
by: Mittra, Tirthankar
Published: (2024)
by: Mittra, Tirthankar
Published: (2024)
Cross-Modal Navigation with Multi-Agent Reinforcement Learning
by: Liu, Shuo, et al.
Published: (2026)
by: Liu, Shuo, et al.
Published: (2026)
Controlling Behavioral Diversity in Multi-Agent Reinforcement Learning
by: Bettini, Matteo, et al.
Published: (2024)
by: Bettini, Matteo, et al.
Published: (2024)
Schema-Guided Scene-Graph Reasoning based on Multi-Agent Large Language Model System
by: Chen, Yiye, et al.
Published: (2025)
by: Chen, Yiye, et al.
Published: (2025)
Selectively Sharing Experiences Improves Multi-Agent Reinforcement Learning
by: Gerstgrasser, Matthias, et al.
Published: (2023)
by: Gerstgrasser, Matthias, et al.
Published: (2023)
ESP: Exploiting Symmetry Prior for Multi-Agent Reinforcement Learning
by: Yu, Xin, et al.
Published: (2023)
by: Yu, Xin, et al.
Published: (2023)
Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning
by: Geles, Ismail, et al.
Published: (2026)
by: Geles, Ismail, et al.
Published: (2026)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
by: Kapoor, Aditya, et al.
Published: (2024)
by: Kapoor, Aditya, et al.
Published: (2024)
Online Action-Stacking Improves Reinforcement Learning Performance for Air Traffic Control
by: Carvell, Ben, et al.
Published: (2026)
by: Carvell, Ben, et al.
Published: (2026)
Enhancing Aerial Combat Tactics through Hierarchical Multi-Agent Reinforcement Learning
by: Selmonaj, Ardian, et al.
Published: (2025)
by: Selmonaj, Ardian, et al.
Published: (2025)
Multi-Agent Inverse Reinforcement Learning in Real World Unstructured Pedestrian Crowds
by: Chandra, Rohan, et al.
Published: (2024)
by: Chandra, Rohan, et al.
Published: (2024)
Scalable Multi-Agent Reinforcement Learning for Warehouse Logistics with Robotic and Human Co-Workers
by: Krnjaic, Aleksandar, et al.
Published: (2022)
by: Krnjaic, Aleksandar, et al.
Published: (2022)
Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense
by: Mukherjee, Sayak, et al.
Published: (2025)
by: Mukherjee, Sayak, et al.
Published: (2025)
Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning
by: Radha, Santosh Kumar, et al.
Published: (2024)
by: Radha, Santosh Kumar, et al.
Published: (2024)
Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks
by: Lau, Gregory Kang Ruey, et al.
Published: (2024)
by: Lau, Gregory Kang Ruey, et al.
Published: (2024)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
by: Kim, Hyeonjun, et al.
Published: (2025)
by: Kim, Hyeonjun, et al.
Published: (2025)
Communication-Free Collective Navigation for a Swarm of UAVs via LiDAR-Based Deep Reinforcement Learning
by: Choi, Myong-Yol, et al.
Published: (2026)
by: Choi, Myong-Yol, et al.
Published: (2026)
TorchDriveEnv: A Reinforcement Learning Benchmark for Autonomous Driving with Reactive, Realistic, and Diverse Non-Playable Characters
by: Lavington, Jonathan Wilder, et al.
Published: (2024)
by: Lavington, Jonathan Wilder, et al.
Published: (2024)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025)
by: Wan, Ziyu, et al.
Published: (2025)
HiMAP: Learning Heuristics-Informed Policies for Large-Scale Multi-Agent Pathfinding
by: Tang, Huijie, et al.
Published: (2024)
by: Tang, Huijie, et al.
Published: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
by: Liao, Junwei, et al.
Published: (2025)
by: Liao, Junwei, et al.
Published: (2025)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
Heterogeneous Multi-Agent Reinforcement Learning for Zero-Shot Scalable Collaboration
by: Guo, Xudong, et al.
Published: (2024)
by: Guo, Xudong, et al.
Published: (2024)
WebATLAS: An LLM Agent with Experience-Driven Memory and Action Simulation
by: Cheng, Jiali, et al.
Published: (2025)
by: Cheng, Jiali, et al.
Published: (2025)
Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness
by: Parthasarathy, Ambreesh, et al.
Published: (2025)
by: Parthasarathy, Ambreesh, et al.
Published: (2025)
Editing Personality for Large Language Models
by: Mao, Shengyu, et al.
Published: (2023)
by: Mao, Shengyu, et al.
Published: (2023)
Learning Team-Based Navigation: A Review of Deep Reinforcement Learning Techniques for Multi-Agent Pathfinding
by: Chung, Jaehoon, et al.
Published: (2023)
by: Chung, Jaehoon, et al.
Published: (2023)
Coordinated Strategies in Realistic Air Combat by Hierarchical Multi-Agent Reinforcement Learning
by: Selmonaj, Ardian, et al.
Published: (2025)
by: Selmonaj, Ardian, et al.
Published: (2025)
Similar Items
-
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
by: Sun, Chuanneng, et al.
Published: (2024) -
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
by: Kapoor, Aditya, et al.
Published: (2025) -
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
by: Kong, Lingxiao, et al.
Published: (2025) -
MinionsLLM: a Task-adaptive Framework For The Training and Control of Multi-Agent Systems Through Natural Language
by: Rincon, Andres Garcia, et al.
Published: (2025) -
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
by: Mo, Shentong, et al.
Published: (2026)