SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Hanlin, Leong, Chak Tou, Wang, Jiashuo, Wang, Jian, Li, Wenjie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
par: Wang, Hanlin, et autres
Publié: (2025)
par: Wang, Hanlin, et autres
Publié: (2025)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
par: Wang, Hanlin, et autres
Publié: (2026)
par: Wang, Hanlin, et autres
Publié: (2026)
E2CL: Exploration-based Error Correction Learning for Embodied Agents
par: Wang, Hanlin, et autres
Publié: (2024)
par: Wang, Hanlin, et autres
Publié: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
Mitigating Unhelpfulness in Emotional Support Conversations with Multifaceted AI Feedback
par: Wang, Jiashuo, et autres
Publié: (2024)
par: Wang, Jiashuo, et autres
Publié: (2024)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
par: Leong, Chak Tou, et autres
Publié: (2024)
par: Leong, Chak Tou, et autres
Publié: (2024)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
par: Wang, Jian, et autres
Publié: (2024)
par: Wang, Jian, et autres
Publié: (2024)
Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models
par: Liu, Youwei, et autres
Publié: (2026)
par: Liu, Youwei, et autres
Publié: (2026)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
par: Leong, Chak Tou, et autres
Publié: (2025)
par: Leong, Chak Tou, et autres
Publié: (2025)
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
par: Yin, Qingyu, et autres
Publié: (2024)
par: Yin, Qingyu, et autres
Publié: (2024)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
par: Wang, Zhenting, et autres
Publié: (2026)
par: Wang, Zhenting, et autres
Publié: (2026)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
par: Lin, Zihan, et autres
Publié: (2026)
par: Lin, Zihan, et autres
Publié: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Probing Cultural Awareness in LLMs: A Case Study of Cross-Culture Aesthetic Stylistics
par: Wang, Jiashuo, et autres
Publié: (2026)
par: Wang, Jiashuo, et autres
Publié: (2026)
ProCut: LLM Prompt Compression via Attribution Estimation
par: Xu, Zhentao, et autres
Publié: (2025)
par: Xu, Zhentao, et autres
Publié: (2025)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
par: Wang, Shaobo, et autres
Publié: (2026)
par: Wang, Shaobo, et autres
Publié: (2026)
SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection
par: Tang, Kexian, et autres
Publié: (2026)
par: Tang, Kexian, et autres
Publié: (2026)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
par: Zhang, Kaiyi, et autres
Publié: (2025)
par: Zhang, Kaiyi, et autres
Publié: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
par: Shi, Yucheng, et autres
Publié: (2025)
par: Shi, Yucheng, et autres
Publié: (2025)
COMAP: Co-Evolving World Models and Agent Policies for LLM Agents
par: Liu, Youwei, et autres
Publié: (2026)
par: Liu, Youwei, et autres
Publié: (2026)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
par: Leong, Chak Tou, et autres
Publié: (2026)
par: Leong, Chak Tou, et autres
Publié: (2026)
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
par: Li, Bolian, et autres
Publié: (2026)
par: Li, Bolian, et autres
Publié: (2026)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
par: Hou, Zhenyu, et autres
Publié: (2025)
par: Hou, Zhenyu, et autres
Publié: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
par: Wang, Jiacheng, et autres
Publié: (2026)
par: Wang, Jiacheng, et autres
Publié: (2026)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
par: Su, Guangxin, et autres
Publié: (2025)
par: Su, Guangxin, et autres
Publié: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
par: Luo, Sijia, et autres
Publié: (2026)
par: Luo, Sijia, et autres
Publié: (2026)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
par: Zhang, Yuxin, et autres
Publié: (2025)
par: Zhang, Yuxin, et autres
Publié: (2025)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
par: Zhang, Shenao, et autres
Publié: (2025)
par: Zhang, Shenao, et autres
Publié: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024)
par: Gao, Jiaxuan, et autres
Publié: (2024)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
par: Xu, Wujiang, et autres
Publié: (2025)
par: Xu, Wujiang, et autres
Publié: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning
par: Liu, Zihe, et autres
Publié: (2025)
par: Liu, Zihe, et autres
Publié: (2025)
Documents similaires
-
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
par: Wang, Hanlin, et autres
Publié: (2025) -
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
par: Wang, Hanlin, et autres
Publié: (2026) -
E2CL: Exploration-based Error Correction Learning for Embodied Agents
par: Wang, Hanlin, et autres
Publié: (2024) -
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
par: Wang, Jian, et autres
Publié: (2025) -
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
par: Xia, Heming, et autres
Publié: (2025)