Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Jiawei, Yang, Qingping, Zheng, Renjie, Chen, Jiaze |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
par: Yuan, Danlong, et autres
Publié: (2026)
par: Yuan, Danlong, et autres
Publié: (2026)
SWE-Bench-CL: Continual Learning for Coding Agents
par: Joshi, Thomas, et autres
Publié: (2025)
par: Joshi, Thomas, et autres
Publié: (2025)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
par: Ding, Yifeng, et autres
Publié: (2026)
par: Ding, Yifeng, et autres
Publié: (2026)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
par: Chen, Jie, et autres
Publié: (2024)
par: Chen, Jie, et autres
Publié: (2024)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
par: Li, Xin-Ye, et autres
Publié: (2026)
par: Li, Xin-Ye, et autres
Publié: (2026)
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
par: Xia, Chunqiu Steven, et autres
Publié: (2025)
par: Xia, Chunqiu Steven, et autres
Publié: (2025)
ADReFT: Adaptive Decision Repair for Safe Autonomous Driving via Reinforcement Fine-Tuning
par: Cheng, Mingfei, et autres
Publié: (2025)
par: Cheng, Mingfei, et autres
Publié: (2025)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
par: Chen, Mouxiang, et autres
Publié: (2026)
par: Chen, Mouxiang, et autres
Publié: (2026)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
par: Shetty, Manish, et autres
Publié: (2025)
par: Shetty, Manish, et autres
Publié: (2025)
SWE-Protégé: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering Agents
par: Kon, Patrick Tser Jern, et autres
Publié: (2026)
par: Kon, Patrick Tser Jern, et autres
Publié: (2026)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
par: Wei, Yuxiang, et autres
Publié: (2025)
par: Wei, Yuxiang, et autres
Publié: (2025)
SWE-Spot: Building Small Repo-Experts with Repository-Centric Learning
par: Peng, Jinjun, et autres
Publié: (2026)
par: Peng, Jinjun, et autres
Publié: (2026)
Free and Customizable Code Documentation with LLMs: A Fine-Tuning Approach
par: Chakrabarty, Sayak, et autres
Publié: (2024)
par: Chakrabarty, Sayak, et autres
Publié: (2024)
One Model, Many Skills: Parameter-Efficient Fine-Tuning for Multitask Code Analysis
par: Akli, Amal, et autres
Publié: (2026)
par: Akli, Amal, et autres
Publié: (2026)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
par: Zhu, Sicheng, et autres
Publié: (2026)
par: Zhu, Sicheng, et autres
Publié: (2026)
Parameter-Efficient Fine-Tuning of Large Language Models for Unit Test Generation: An Empirical Study
par: Storhaug, André, et autres
Publié: (2024)
par: Storhaug, André, et autres
Publié: (2024)
Keeping Code-Aware LLMs Fresh: Full Refresh, In-Context Deltas, and Incremental Fine-Tuning
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
par: Raghavendra, Mohit, et autres
Publié: (2026)
par: Raghavendra, Mohit, et autres
Publié: (2026)
Causal Fuzzing for Verifying Machine Unlearning
par: Mazhar, Anna, et autres
Publié: (2025)
par: Mazhar, Anna, et autres
Publié: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
par: Fan, Lishui, et autres
Publié: (2025)
par: Fan, Lishui, et autres
Publié: (2025)
Clover: Closed-Loop Verifiable Code Generation
par: Sun, Chuyue, et autres
Publié: (2023)
par: Sun, Chuyue, et autres
Publié: (2023)
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
par: Yang, John, et autres
Publié: (2024)
par: Yang, John, et autres
Publié: (2024)
AIPC: Agent-Based Automation for AI Model Deployment with Qualcomm AI Runtime
par: Su, Jianhao, et autres
Publié: (2026)
par: Su, Jianhao, et autres
Publié: (2026)
SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents
par: Zolfagharian, Amirhossein, et autres
Publié: (2023)
par: Zolfagharian, Amirhossein, et autres
Publié: (2023)
SoundnessBench: A Soundness Benchmark for Neural Network Verifiers
par: Zhou, Xingjian, et autres
Publié: (2024)
par: Zhou, Xingjian, et autres
Publié: (2024)
Talking with Verifiers: Automatic Specification Generation for Neural Network Verification
par: Elboher, Yizhak Y., et autres
Publié: (2026)
par: Elboher, Yizhak Y., et autres
Publié: (2026)
LogFormer: A Pre-train and Tuning Pipeline for Log Anomaly Detection
par: Guo, Hongcheng, et autres
Publié: (2024)
par: Guo, Hongcheng, et autres
Publié: (2024)
Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
par: Bai, Yifan, et autres
Publié: (2026)
par: Bai, Yifan, et autres
Publié: (2026)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
par: Xie, Zichen, et autres
Publié: (2026)
par: Xie, Zichen, et autres
Publié: (2026)
Step Rejection Fine-Tuning: A Practical Distillation Recipe
par: Slinko, Igor, et autres
Publié: (2026)
par: Slinko, Igor, et autres
Publié: (2026)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
par: Wang, Lilin, et autres
Publié: (2025)
par: Wang, Lilin, et autres
Publié: (2025)
Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents
par: Yang, Zhenning, et autres
Publié: (2025)
par: Yang, Zhenning, et autres
Publié: (2025)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
par: Deshpande, Darshan, et autres
Publié: (2026)
par: Deshpande, Darshan, et autres
Publié: (2026)
Solution-oriented Agent-based Models Generation with Verifier-assisted Iterative In-context Learning
par: Niu, Tong, et autres
Publié: (2024)
par: Niu, Tong, et autres
Publié: (2024)
TOM-SWE: User Mental Modeling For Software Engineering Agents
par: Zhou, Xuhui, et autres
Publié: (2025)
par: Zhou, Xuhui, et autres
Publié: (2025)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
par: Garg, Spandan, et autres
Publié: (2025)
par: Garg, Spandan, et autres
Publié: (2025)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
par: Jain, Naman, et autres
Publié: (2025)
par: Jain, Naman, et autres
Publié: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
par: Liang, Jiarong, et autres
Publié: (2026)
par: Liang, Jiarong, et autres
Publié: (2026)
LLM-Vectorizer: LLM-based Verified Loop Vectorizer
par: Taneja, Jubi, et autres
Publié: (2024)
par: Taneja, Jubi, et autres
Publié: (2024)
Documents similaires
-
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
par: Yuan, Danlong, et autres
Publié: (2026) -
SWE-Bench-CL: Continual Learning for Coding Agents
par: Joshi, Thomas, et autres
Publié: (2025) -
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
par: Ding, Yifeng, et autres
Publié: (2026) -
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
par: Chen, Jie, et autres
Publié: (2024) -
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
par: Li, Xin-Ye, et autres
Publié: (2026)