Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
Fuente:
arXiv
Salvato in:
| Autori principali: | Pang, Jing-Cheng, Yang, Si-Hang, Li, Kaiyuan, Zhang, Jiaji, Chen, Xiong-Hui, Tang, Nan, Yu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2025)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2025)
VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents
di: Liu, Pengsen, et al.
Pubblicazione: (2026)
di: Liu, Pengsen, et al.
Pubblicazione: (2026)
Empowering Working Memory for Large Language Model Agents
di: Guo, Jing, et al.
Pubblicazione: (2023)
di: Guo, Jing, et al.
Pubblicazione: (2023)
Empowering Language Models with Active Inquiry for Deeper Understanding
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
di: Xiang, Yufei, et al.
Pubblicazione: (2025)
di: Xiang, Yufei, et al.
Pubblicazione: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
di: Li, Hang, et al.
Pubblicazione: (2025)
di: Li, Hang, et al.
Pubblicazione: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
Knowledge Tagging with Large Language Model based Multi-Agent System
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
$μ$KE: Matryoshka Unstructured Knowledge Editing of Large Language Models
di: Su, Zian, et al.
Pubblicazione: (2025)
di: Su, Zian, et al.
Pubblicazione: (2025)
APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation
di: Zheng, Tianyu, et al.
Pubblicazione: (2026)
di: Zheng, Tianyu, et al.
Pubblicazione: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Two Heads Are Better Than One: Integrating Knowledge from Knowledge Graphs and Large Language Models for Entity Alignment
di: Yang, Linyao, et al.
Pubblicazione: (2024)
di: Yang, Linyao, et al.
Pubblicazione: (2024)
DynaWeb: Model-Based Reinforcement Learning of Web Agents
di: Ding, Hang, et al.
Pubblicazione: (2026)
di: Ding, Hang, et al.
Pubblicazione: (2026)
Empowering Large Language Model Agents through Action Learning
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
di: Zhao, Haiteng, et al.
Pubblicazione: (2024)
A General Highly Accurate Online Planning Method Integrating Large Language Models into Nested Rollout Policy Adaptation for Dialogue Tasks
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering
di: Hu, Zhongjian, et al.
Pubblicazione: (2024)
di: Hu, Zhongjian, et al.
Pubblicazione: (2024)
One-Shot Learning as Instruction Data Prospector for Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2023)
di: Li, Yunshui, et al.
Pubblicazione: (2023)
Towards Repository-Level Program Verification with Large Language Models
di: Zhong, Si Cheng, et al.
Pubblicazione: (2025)
di: Zhong, Si Cheng, et al.
Pubblicazione: (2025)
Offline Learning and Forgetting for Reasoning with Large Language Models
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution
di: Li, Kaiyuan, et al.
Pubblicazione: (2026)
di: Li, Kaiyuan, et al.
Pubblicazione: (2026)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
di: Du, Dong, et al.
Pubblicazione: (2025)
di: Du, Dong, et al.
Pubblicazione: (2025)
LightPROF: A Lightweight Reasoning Framework for Large Language Model on Knowledge Graph
di: Ao, Tu, et al.
Pubblicazione: (2025)
di: Ao, Tu, et al.
Pubblicazione: (2025)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
di: Wang, Zizhao, et al.
Pubblicazione: (2025)
di: Wang, Zizhao, et al.
Pubblicazione: (2025)
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
di: Luo, Sijia, et al.
Pubblicazione: (2026)
di: Luo, Sijia, et al.
Pubblicazione: (2026)
Contrastive Learning for Knowledge-Based Question Generation in Large Language Models
di: Zhang, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhang, Zhenhong, et al.
Pubblicazione: (2024)
Knowledge Boundary and Persona Dynamic Shape A Better Social Media Agent
di: Zhou, Junkai, et al.
Pubblicazione: (2024)
di: Zhou, Junkai, et al.
Pubblicazione: (2024)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
di: Ding, Keyan, et al.
Pubblicazione: (2025)
di: Ding, Keyan, et al.
Pubblicazione: (2025)
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
di: Xiong, Chen, et al.
Pubblicazione: (2025)
di: Xiong, Chen, et al.
Pubblicazione: (2025)
Offline Training of Language Model Agents with Functions as Learnable Weights
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
LLM-Gomoku: A Large Language Model-Based System for Strategic Gomoku with Self-Play and Reinforcement Learning
di: Wang, Hui
Pubblicazione: (2025)
di: Wang, Hui
Pubblicazione: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
A Survey on Large Language Model based Autonomous Agents
di: Wang, Lei, et al.
Pubblicazione: (2023)
di: Wang, Lei, et al.
Pubblicazione: (2023)
Documenti analoghi
-
ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2025) -
VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents
di: Liu, Pengsen, et al.
Pubblicazione: (2026) -
Empowering Working Memory for Large Language Model Agents
di: Guo, Jing, et al.
Pubblicazione: (2023) -
Empowering Language Models with Active Inquiry for Deeper Understanding
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024) -
Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
di: Xiang, Yufei, et al.
Pubblicazione: (2025)