Agentic Reinforcement Learning for Real-World Code Repair
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Siyu, Karpovich, Anastasiya, Chen, Albert, Koscheka, Jessica, Jannu, Shailesh, Wen, Di, Zhu, Yuqing, Jain, Rohit, Geramifard, Alborz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sequential Decision-Making for Inline Text Autocomplete
par: Chitnis, Rohan, et autres
Publié: (2024)
par: Chitnis, Rohan, et autres
Publié: (2024)
Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
par: Zhu, Siyu, et autres
Publié: (2025)
par: Zhu, Siyu, et autres
Publié: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
par: Chen, Xiwen, et autres
Publié: (2026)
par: Chen, Xiwen, et autres
Publié: (2026)
When should we prefer Decision Transformers for Offline Reinforcement Learning?
par: Bhargava, Prajjwal, et autres
Publié: (2023)
par: Bhargava, Prajjwal, et autres
Publié: (2023)
SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning
par: Sikchi, Harshit, et autres
Publié: (2023)
par: Sikchi, Harshit, et autres
Publié: (2023)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026)
par: Yang, Jie, et autres
Publié: (2026)
MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
par: Liu, Simiao, et autres
Publié: (2026)
par: Liu, Simiao, et autres
Publié: (2026)
T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning
par: Xia, Hanchen, et autres
Publié: (2026)
par: Xia, Hanchen, et autres
Publié: (2026)
Agentic Reinforced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Fighting Spurious Correlations in Text Classification via a Causal Learning Perspective
par: Zhou, Yuqing, et autres
Publié: (2024)
par: Zhou, Yuqing, et autres
Publié: (2024)
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
par: Cao, Zongwan, et autres
Publié: (2026)
par: Cao, Zongwan, et autres
Publié: (2026)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
par: Xiao, Teng, et autres
Publié: (2026)
par: Xiao, Teng, et autres
Publié: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025)
par: Hu, Ziyou, et autres
Publié: (2025)
Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning
par: Lin, Junhong, et autres
Publié: (2025)
par: Lin, Junhong, et autres
Publié: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
par: Wang, Zhaoyang, et autres
Publié: (2026)
par: Wang, Zhaoyang, et autres
Publié: (2026)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Agentic Reinforcement Learning for Search is Unsafe
par: Yang, Yushi, et autres
Publié: (2025)
par: Yang, Yushi, et autres
Publié: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
par: Yu, Zhaochen, et autres
Publié: (2025)
par: Yu, Zhaochen, et autres
Publié: (2025)
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
par: Zhu, Siyu, et autres
Publié: (2025)
par: Zhu, Siyu, et autres
Publié: (2025)
MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use
par: Lei, Fei, et autres
Publié: (2025)
par: Lei, Fei, et autres
Publié: (2025)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
TIP: Token Importance in On-Policy Distillation
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning
par: Luo, Haoran, et autres
Publié: (2025)
par: Luo, Haoran, et autres
Publié: (2025)
Agentic-R: Learning to Retrieve for Agentic Search
par: Liu, Wenhan, et autres
Publié: (2026)
par: Liu, Wenhan, et autres
Publié: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
par: Zhu, Jiapeng, et autres
Publié: (2026)
par: Zhu, Jiapeng, et autres
Publié: (2026)
ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse
par: Liu, Simiao, et autres
Publié: (2026)
par: Liu, Simiao, et autres
Publié: (2026)
Semantic Gravity Wells: Why Negative Constraints Backfire
par: Rana, Shailesh
Publié: (2026)
par: Rana, Shailesh
Publié: (2026)
CodeComp: Structural KV Cache Compression for Agentic Coding
par: Chen, Qiujiang, et autres
Publié: (2026)
par: Chen, Qiujiang, et autres
Publié: (2026)
Can LLMs Infer Personality from Real World Conversations?
par: Zhu, Jianfeng, et autres
Publié: (2025)
par: Zhu, Jianfeng, et autres
Publié: (2025)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems
par: Shukla, Manish
Publié: (2025)
par: Shukla, Manish
Publié: (2025)
Real-World Doctor Agent with Proactive Consultation through Multi-Agent Reinforcement Learning
par: Feng, Yichun, et autres
Publié: (2025)
par: Feng, Yichun, et autres
Publié: (2025)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
par: Wang, Daoyu, et autres
Publié: (2026)
par: Wang, Daoyu, et autres
Publié: (2026)
How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine Translation
par: Meng, Yan, et autres
Publié: (2024)
par: Meng, Yan, et autres
Publié: (2024)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
par: Zhang, Lei, et autres
Publié: (2024)
par: Zhang, Lei, et autres
Publié: (2024)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
par: Zhang, Guibin, et autres
Publié: (2025)
par: Zhang, Guibin, et autres
Publié: (2025)
Internalizing World Models via Self-Play Finetuning for Agentic RL
par: Chen, Shiqi, et autres
Publié: (2025)
par: Chen, Shiqi, et autres
Publié: (2025)
Self-Distilled Agentic Reinforcement Learning
par: Lu, Zhengxi, et autres
Publié: (2026)
par: Lu, Zhengxi, et autres
Publié: (2026)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
par: Zhao, Yubao, et autres
Publié: (2026)
par: Zhao, Yubao, et autres
Publié: (2026)
Documents similaires
-
Sequential Decision-Making for Inline Text Autocomplete
par: Chitnis, Rohan, et autres
Publié: (2024) -
Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
par: Zhu, Siyu, et autres
Publié: (2025) -
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
par: Chen, Xiwen, et autres
Publié: (2026) -
When should we prefer Decision Transformers for Offline Reinforcement Learning?
par: Bhargava, Prajjwal, et autres
Publié: (2023) -
SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning
par: Sikchi, Harshit, et autres
Publié: (2023)