TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Djuhera, Aladin, Kadhe, Swanand Ravindra, Ahmed, Farhan, Zawad, Syed, Ludwig, Heiko, Boche, Holger |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
von: Kadhe, Swanand Ravindra, et al.
Veröffentlicht: (2024)
von: Kadhe, Swanand Ravindra, et al.
Veröffentlicht: (2024)
Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
Turning Generative Models Degenerate: The Power of Data Poisoning Attacks
von: Jiang, Shuli, et al.
Veröffentlicht: (2024)
von: Jiang, Shuli, et al.
Veröffentlicht: (2024)
MambaCSP: Hybrid-Attention State Space Models for Hardware-Efficient Channel State Prediction
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation
von: Seffo, Amin, et al.
Veröffentlicht: (2025)
von: Seffo, Amin, et al.
Veröffentlicht: (2025)
STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs
von: An, Sungeun, et al.
Veröffentlicht: (2026)
von: An, Sungeun, et al.
Veröffentlicht: (2026)
Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection
von: Chowdhury, Anjir Ahmed, et al.
Veröffentlicht: (2026)
von: Chowdhury, Anjir Ahmed, et al.
Veröffentlicht: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
SCoTT: Strategic Chain-of-Thought Tasking for Wireless-Aware Robot Navigation in Digital Twins
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
R-MTLLMF: Resilient Multi-Task Large Language Model Fusion at the Wireless Edge
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts
von: Chowdhury, Anjir Ahmed, et al.
Veröffentlicht: (2026)
von: Chowdhury, Anjir Ahmed, et al.
Veröffentlicht: (2026)
Evaluating the Dynamics of Membership Privacy in Deep Learning
von: Chen, Yuetian, et al.
Veröffentlicht: (2025)
von: Chen, Yuetian, et al.
Veröffentlicht: (2025)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
von: Ngong, Ivoline, et al.
Veröffentlicht: (2025)
von: Ngong, Ivoline, et al.
Veröffentlicht: (2025)
R-SFLLM: Jamming Resilient Framework for Split Federated Learning with Large Language Models
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2024)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
von: Luo, Sijia, et al.
Veröffentlicht: (2026)
von: Luo, Sijia, et al.
Veröffentlicht: (2026)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
von: Hu, Yuanzhe, et al.
Veröffentlicht: (2025)
von: Hu, Yuanzhe, et al.
Veröffentlicht: (2025)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
von: Guan, Shengyue, et al.
Veröffentlicht: (2025)
von: Guan, Shengyue, et al.
Veröffentlicht: (2025)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2025)
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2025)
Enhancing Multi-Class Disease Classification: Neoplasms, Cardiovascular, Nervous System, and Digestive Disorders Using Advanced LLMs
von: Karim, Ahmed Akib Jawad, et al.
Veröffentlicht: (2024)
von: Karim, Ahmed Akib Jawad, et al.
Veröffentlicht: (2024)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
GneissWeb: Preparing High Quality Data for LLMs at Scale
von: Gohari, Hajar Emami, et al.
Veröffentlicht: (2025)
von: Gohari, Hajar Emami, et al.
Veröffentlicht: (2025)
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
von: Xin, Ran, et al.
Veröffentlicht: (2025)
von: Xin, Ran, et al.
Veröffentlicht: (2025)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
von: Lee, Hyomin, et al.
Veröffentlicht: (2026)
von: Lee, Hyomin, et al.
Veröffentlicht: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
von: Zhou, Xiaofan, et al.
Veröffentlicht: (2026)
von: Zhou, Xiaofan, et al.
Veröffentlicht: (2026)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
von: Moore, Robert J., et al.
Veröffentlicht: (2026)
von: Moore, Robert J., et al.
Veröffentlicht: (2026)
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2026)
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
von: Liu, Rui, et al.
Veröffentlicht: (2025)
von: Liu, Rui, et al.
Veröffentlicht: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
von: Yu, Hongli, et al.
Veröffentlicht: (2025)
von: Yu, Hongli, et al.
Veröffentlicht: (2025)
SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning
von: He, Zelin, et al.
Veröffentlicht: (2026)
von: He, Zelin, et al.
Veröffentlicht: (2026)
Drift No More? Context Equilibria in Multi-Turn LLM Interactions
von: Dongre, Vardhan, et al.
Veröffentlicht: (2025)
von: Dongre, Vardhan, et al.
Veröffentlicht: (2025)
Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents
von: Sethi, Khushal
Veröffentlicht: (2026)
von: Sethi, Khushal
Veröffentlicht: (2026)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
von: Ding, Liang
Veröffentlicht: (2026)
von: Ding, Liang
Veröffentlicht: (2026)
Ähnliche Einträge
-
Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025) -
When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025) -
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025) -
SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025) -
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
von: Kadhe, Swanand Ravindra, et al.
Veröffentlicht: (2024)