SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Yifei, Jiang, Song, Tian, Yuandong, Weston, Jason, Levine, Sergey, Sukhbaatar, Sainbayar, Li, Xian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Challenging Language Model Agents
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
von: Su, DiJia, et al.
Veröffentlicht: (2024)
von: Su, DiJia, et al.
Veröffentlicht: (2024)
Training Large Language Models to Reason in a Continuous Latent Space
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
von: Hao, Shibo, et al.
Veröffentlicht: (2024)
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
von: Bai, Hao, et al.
Veröffentlicht: (2024)
von: Bai, Hao, et al.
Veröffentlicht: (2024)
R.I.P.: Better Models by Survival of the Fittest Prompts
von: Yu, Ping, et al.
Veröffentlicht: (2025)
von: Yu, Ping, et al.
Veröffentlicht: (2025)
Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback
von: Lin, Yen-Ting, et al.
Veröffentlicht: (2025)
von: Lin, Yen-Ting, et al.
Veröffentlicht: (2025)
Multi-Token Attention
von: Golovneva, Olga, et al.
Veröffentlicht: (2025)
von: Golovneva, Olga, et al.
Veröffentlicht: (2025)
Reverse Training to Nurse the Reversal Curse
von: Golovneva, Olga, et al.
Veröffentlicht: (2024)
von: Golovneva, Olga, et al.
Veröffentlicht: (2024)
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
von: Bai, Hao, et al.
Veröffentlicht: (2025)
von: Bai, Hao, et al.
Veröffentlicht: (2025)
Composing Global Solutions to Reasoning Tasks via Algebraic Objects in Neural Nets
von: Tian, Yuandong
Veröffentlicht: (2024)
von: Tian, Yuandong
Veröffentlicht: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
von: Wu, Tianhao, et al.
Veröffentlicht: (2024)
von: Wu, Tianhao, et al.
Veröffentlicht: (2024)
Contextual Position Encoding: Learning to Count What's Important
von: Golovneva, Olga, et al.
Veröffentlicht: (2024)
von: Golovneva, Olga, et al.
Veröffentlicht: (2024)
Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss
von: Xu, Jing, et al.
Veröffentlicht: (2023)
von: Xu, Jing, et al.
Veröffentlicht: (2023)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
LLM Pretraining with Continuous Concepts
von: Tack, Jihoon, et al.
Veröffentlicht: (2025)
von: Tack, Jihoon, et al.
Veröffentlicht: (2025)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
von: Wei, Quan, et al.
Veröffentlicht: (2025)
von: Wei, Quan, et al.
Veröffentlicht: (2025)
Stochastic activations
von: Lomeli, Maria, et al.
Veröffentlicht: (2025)
von: Lomeli, Maria, et al.
Veröffentlicht: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
Training LLM Agents to Empower Humans
von: Ellis, Evan, et al.
Veröffentlicht: (2025)
von: Ellis, Evan, et al.
Veröffentlicht: (2025)
Self-Consistency Preference Optimization
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
ViVa: Video-Trained Value Functions for Guiding Online RL from Diverse Data
von: Dashora, Nitish, et al.
Veröffentlicht: (2025)
von: Dashora, Nitish, et al.
Veröffentlicht: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
von: Xia, Peng, et al.
Veröffentlicht: (2025)
von: Xia, Peng, et al.
Veröffentlicht: (2025)
Self-Improving Pretraining: using post-trained models to pretrain better models
von: Tan, Ellen Xiaoqing, et al.
Veröffentlicht: (2026)
von: Tan, Ellen Xiaoqing, et al.
Veröffentlicht: (2026)
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
von: Wang, Prince Zizhuang, et al.
Veröffentlicht: (2026)
von: Wang, Prince Zizhuang, et al.
Veröffentlicht: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
von: Liu, Yixin, et al.
Veröffentlicht: (2026)
von: Liu, Yixin, et al.
Veröffentlicht: (2026)
Training RL Agents for Multi-Objective Network Defense Tasks
von: Molina-Markham, Andres, et al.
Veröffentlicht: (2025)
von: Molina-Markham, Andres, et al.
Veröffentlicht: (2025)
Teaching Large Language Models to Reason with Reinforcement Learning
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
von: Li, Junbo, et al.
Veröffentlicht: (2025)
von: Li, Junbo, et al.
Veröffentlicht: (2025)
RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes
von: Stachowicz, Kyle, et al.
Veröffentlicht: (2024)
von: Stachowicz, Kyle, et al.
Veröffentlicht: (2024)
Multi-Agent Path Finding via Offline RL and LLM Collaboration
von: Atasever, Merve, et al.
Veröffentlicht: (2025)
von: Atasever, Merve, et al.
Veröffentlicht: (2025)
Iterative Reasoning Preference Optimization
von: Pang, Richard Yuanzhe, et al.
Veröffentlicht: (2024)
von: Pang, Richard Yuanzhe, et al.
Veröffentlicht: (2024)
Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning
von: Hu, Hanjiang, et al.
Veröffentlicht: (2025)
von: Hu, Hanjiang, et al.
Veröffentlicht: (2025)
METRA: Scalable Unsupervised RL with Metric-Aware Abstraction
von: Park, Seohong, et al.
Veröffentlicht: (2023)
von: Park, Seohong, et al.
Veröffentlicht: (2023)
In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration
von: Choi, Youngbin, et al.
Veröffentlicht: (2025)
von: Choi, Youngbin, et al.
Veröffentlicht: (2025)
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
von: Yang, Ning, et al.
Veröffentlicht: (2026)
von: Yang, Ning, et al.
Veröffentlicht: (2026)
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
von: Tian, Yuandong
Veröffentlicht: (2025)
von: Tian, Yuandong
Veröffentlicht: (2025)
MALT: Improving Reasoning with Multi-Agent LLM Training
von: Motwani, Sumeet Ramesh, et al.
Veröffentlicht: (2024)
von: Motwani, Sumeet Ramesh, et al.
Veröffentlicht: (2024)
LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
von: Nie, Yuzhou, et al.
Veröffentlicht: (2024)
von: Nie, Yuzhou, et al.
Veröffentlicht: (2024)
GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection
von: Zhao, Jiawei, et al.
Veröffentlicht: (2024)
von: Zhao, Jiawei, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Self-Challenging Language Model Agents
von: Zhou, Yifei, et al.
Veröffentlicht: (2025) -
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024) -
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
von: Su, DiJia, et al.
Veröffentlicht: (2024) -
Training Large Language Models to Reason in a Continuous Latent Space
von: Hao, Shibo, et al.
Veröffentlicht: (2024) -
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
von: Bai, Hao, et al.
Veröffentlicht: (2024)