ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yifei, Zanette, Andrea, Pan, Jiayi, Levine, Sergey, Kumar, Aviral |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Challenging Language Model Agents
par: Zhou, Yifei, et autres
Publié: (2025)
par: Zhou, Yifei, et autres
Publié: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
par: Kang, Katie, et autres
Publié: (2024)
par: Kang, Katie, et autres
Publié: (2024)
Is Value Learning Really the Main Bottleneck in Offline RL?
par: Park, Seohong, et autres
Publié: (2024)
par: Park, Seohong, et autres
Publié: (2024)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
par: Abdulhai, Marwa, et autres
Publié: (2025)
par: Abdulhai, Marwa, et autres
Publié: (2025)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
par: Wu, Mian, et autres
Publié: (2025)
par: Wu, Mian, et autres
Publié: (2025)
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
par: Xu, Jun, et autres
Publié: (2025)
par: Xu, Jun, et autres
Publié: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
par: Zhai, Yuexiang, et autres
Publié: (2024)
par: Zhai, Yuexiang, et autres
Publié: (2024)
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
par: Abdulhai, Marwa, et autres
Publié: (2025)
par: Abdulhai, Marwa, et autres
Publié: (2025)
Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
par: Hong, Joey, et autres
Publié: (2025)
par: Hong, Joey, et autres
Publié: (2025)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
par: Qu, Yuxiao, et autres
Publié: (2024)
par: Qu, Yuxiao, et autres
Publié: (2024)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Autonomous Evaluation and Refinement of Digital Agents
par: Pan, Jiayi, et autres
Publié: (2024)
par: Pan, Jiayi, et autres
Publié: (2024)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
par: Djuhera, Aladin, et autres
Publié: (2026)
par: Djuhera, Aladin, et autres
Publié: (2026)
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
par: Bai, Hao, et autres
Publié: (2024)
par: Bai, Hao, et autres
Publié: (2024)
Horizon Reduction Makes RL Scalable
par: Park, Seohong, et autres
Publié: (2025)
par: Park, Seohong, et autres
Publié: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
par: Li, Weizhen, et autres
Publié: (2025)
par: Li, Weizhen, et autres
Publié: (2025)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
par: Chang, Qikai, et autres
Publié: (2025)
par: Chang, Qikai, et autres
Publié: (2025)
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026)
par: Ma, Zhiqing, et autres
Publié: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Learning Adaptive Parallel Reasoning with Language Models
par: Pan, Jiayi, et autres
Publié: (2025)
par: Pan, Jiayi, et autres
Publié: (2025)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
par: Yao, Yi, et autres
Publié: (2026)
par: Yao, Yi, et autres
Publié: (2026)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
par: Wang, Kangrui, et autres
Publié: (2025)
par: Wang, Kangrui, et autres
Publié: (2025)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
par: Agrawalla, Bhavya, et autres
Publié: (2025)
par: Agrawalla, Bhavya, et autres
Publié: (2025)
IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages
par: Dawar, Aviral, et autres
Publié: (2026)
par: Dawar, Aviral, et autres
Publié: (2026)
ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models
par: Wu, Jiangxu, et autres
Publié: (2025)
par: Wu, Jiangxu, et autres
Publié: (2025)
s3: You Don't Need That Much Data to Train a Search Agent via RL
par: Jiang, Pengcheng, et autres
Publié: (2025)
par: Jiang, Pengcheng, et autres
Publié: (2025)
Stop Regressing: Training Value Functions via Classification for Scalable Deep RL
par: Farebrother, Jesse, et autres
Publié: (2024)
par: Farebrother, Jesse, et autres
Publié: (2024)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
par: Zhou, Andy, et autres
Publié: (2025)
par: Zhou, Andy, et autres
Publié: (2025)
ArXiv-to-Model: A Practical Study of Scientific LM Training
par: Gupta, Anuj
Publié: (2026)
par: Gupta, Anuj
Publié: (2026)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
On the Optimal Reasoning Length for RL-Trained Language Models
par: Nohara, Daisuke, et autres
Publié: (2026)
par: Nohara, Daisuke, et autres
Publié: (2026)
Documents similaires
-
Self-Challenging Language Model Agents
par: Zhou, Yifei, et autres
Publié: (2025) -
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
par: Kang, Katie, et autres
Publié: (2024) -
Is Value Learning Really the Main Bottleneck in Offline RL?
par: Park, Seohong, et autres
Publié: (2024) -
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
par: Abdulhai, Marwa, et autres
Publié: (2025) -
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
par: Wu, Mian, et autres
Publié: (2025)