Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhai, Zhiyuan, Yan, Wenjing, Shao, Xiaodan, Wang, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
par: Zhai, Zhiyuan, et autres
Publié: (2026)
par: Zhai, Zhiyuan, et autres
Publié: (2026)
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
par: Zhai, Zhiyuan, et autres
Publié: (2026)
par: Zhai, Zhiyuan, et autres
Publié: (2026)
Revisable by Design: A Theory of Streaming LLM Agent Execution
par: Zhai, Zhiyuan, et autres
Publié: (2026)
par: Zhai, Zhiyuan, et autres
Publié: (2026)
Expanding LLM Agent Boundaries with Strategy-Guided Exploration
par: Szot, Andrew, et autres
Publié: (2026)
par: Szot, Andrew, et autres
Publié: (2026)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
par: Zeng, Yifan, et autres
Publié: (2026)
par: Zeng, Yifan, et autres
Publié: (2026)
Normalizing Flows are Capable Models for RL
par: Ghugare, Raj, et autres
Publié: (2025)
par: Ghugare, Raj, et autres
Publié: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
par: Wang, Hanlin, et autres
Publié: (2025)
par: Wang, Hanlin, et autres
Publié: (2025)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
par: Yao, Zhiyuan, et autres
Publié: (2026)
par: Yao, Zhiyuan, et autres
Publié: (2026)
Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor
par: Liu, Siyuan, et autres
Publié: (2025)
par: Liu, Siyuan, et autres
Publié: (2025)
Quantifying the Capability Boundary of DeepSeek Models: An Application-Driven Performance Analysis
par: Zhao, Kaikai, et autres
Publié: (2025)
par: Zhao, Kaikai, et autres
Publié: (2025)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
par: Zhou, Yifei, et autres
Publié: (2025)
par: Zhou, Yifei, et autres
Publié: (2025)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
par: Hu, Zhengding, et autres
Publié: (2026)
par: Hu, Zhengding, et autres
Publié: (2026)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
par: Wang, Zhenting, et autres
Publié: (2026)
par: Wang, Zhenting, et autres
Publié: (2026)
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
par: Yang, Zhicheng, et autres
Publié: (2025)
par: Yang, Zhicheng, et autres
Publié: (2025)
PASS: Private Attributes Protection with Stochastic Data Substitution
par: Chen, Yizhuo, et autres
Publié: (2025)
par: Chen, Yizhuo, et autres
Publié: (2025)
LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
par: Nie, Yuzhou, et autres
Publié: (2024)
par: Nie, Yuzhou, et autres
Publié: (2024)
LLM Augmented LLMs: Expanding Capabilities through Composition
par: Bansal, Rachit, et autres
Publié: (2024)
par: Bansal, Rachit, et autres
Publié: (2024)
Expanding the Capabilities of Reinforcement Learning via Text Feedback
par: Song, Yuda, et autres
Publié: (2026)
par: Song, Yuda, et autres
Publié: (2026)
Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization
par: Zhai, Zhiyuan, et autres
Publié: (2026)
par: Zhai, Zhiyuan, et autres
Publié: (2026)
CurveRL: Principled Distribution-Aware Context Reweighting for LLM Reasoning
par: Sun, Ke, et autres
Publié: (2026)
par: Sun, Ke, et autres
Publié: (2026)
Evaluating PhaseNet on Teleseismic Data with MsPASS
par: Ma, Jinxin, et autres
Publié: (2026)
par: Ma, Jinxin, et autres
Publié: (2026)
Problem-Parameter-Free Decentralized Bilevel Optimization
par: Zhai, Zhiwei, et autres
Publié: (2025)
par: Zhai, Zhiwei, et autres
Publié: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
par: Zhang, Qiang, et autres
Publié: (2026)
par: Zhang, Qiang, et autres
Publié: (2026)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents
par: Liu, Zhihan, et autres
Publié: (2026)
par: Liu, Zhihan, et autres
Publié: (2026)
MATH-Beyond: A Benchmark for RL to Expand Beyond the Base Model
par: Mayilvahanan, Prasanna, et autres
Publié: (2025)
par: Mayilvahanan, Prasanna, et autres
Publié: (2025)
Assessing the Zero-Shot Capabilities of LLMs for Action Evaluation in RL
par: Pignatelli, Eduardo, et autres
Publié: (2024)
par: Pignatelli, Eduardo, et autres
Publié: (2024)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
par: Yu, Hongli, et autres
Publié: (2025)
par: Yu, Hongli, et autres
Publié: (2025)
CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis
par: Wei, Anjiang, et autres
Publié: (2025)
par: Wei, Anjiang, et autres
Publié: (2025)
RL in the Wild: Characterizing RLVR Training in LLM Deployment
par: Zhou, Jiecheng, et autres
Publié: (2025)
par: Zhou, Jiecheng, et autres
Publié: (2025)
Enhancing RL Safety with Counterfactual LLM Reasoning
par: Gross, Dennis, et autres
Publié: (2024)
par: Gross, Dennis, et autres
Publié: (2024)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
par: Djuhera, Aladin, et autres
Publié: (2026)
par: Djuhera, Aladin, et autres
Publié: (2026)
Multi-Agent Path Finding via Offline RL and LLM Collaboration
par: Atasever, Merve, et autres
Publié: (2025)
par: Atasever, Merve, et autres
Publié: (2025)
How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
par: Park, Simon, et autres
Publié: (2025)
par: Park, Simon, et autres
Publié: (2025)
How does Your RL Agent Explore? An Optimal Transport Analysis of Occupancy Measure Trajectories
par: Nkhumise, Reabetswe M., et autres
Publié: (2024)
par: Nkhumise, Reabetswe M., et autres
Publié: (2024)
Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks
par: Wang, Kun, et autres
Publié: (2026)
par: Wang, Kun, et autres
Publié: (2026)
Sundial: A Family of Highly Capable Time Series Foundation Models
par: Liu, Yong, et autres
Publié: (2025)
par: Liu, Yong, et autres
Publié: (2025)
Compute-Optimal Scaling for Value-Based Deep RL
par: Fu, Preston, et autres
Publié: (2025)
par: Fu, Preston, et autres
Publié: (2025)
PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
par: Feng, Yushi, et autres
Publié: (2025)
par: Feng, Yushi, et autres
Publié: (2025)
Documents similaires
-
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
par: Zhai, Zhiyuan, et autres
Publié: (2026) -
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
par: Zhai, Zhiyuan, et autres
Publié: (2026) -
Revisable by Design: A Theory of Streaming LLM Agent Execution
par: Zhai, Zhiyuan, et autres
Publié: (2026) -
Expanding LLM Agent Boundaries with Strategy-Guided Exploration
par: Szot, Andrew, et autres
Publié: (2026) -
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
par: Zeng, Yifan, et autres
Publié: (2026)