Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Haojin, Jian, Ai, Huang, Xinyue, Wang, Yiwei, Zhang, Weipeng, Zeng, Ke, Cai, Xunliang, Ruan, Jingqing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
by: Jian, Ai, et al.
Published: (2025)
by: Jian, Ai, et al.
Published: (2025)
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
by: Jian, Ai, et al.
Published: (2026)
by: Jian, Ai, et al.
Published: (2026)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
by: Zheng, Binbin, et al.
Published: (2026)
by: Zheng, Binbin, et al.
Published: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
by: Tan, Hui-Ze, et al.
Published: (2026)
by: Tan, Hui-Ze, et al.
Published: (2026)
Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy
by: Zhang, Xiaoyun, et al.
Published: (2025)
by: Zhang, Xiaoyun, et al.
Published: (2025)
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
by: Jia, Nan, et al.
Published: (2026)
by: Jia, Nan, et al.
Published: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
by: Auzina, Ilze Amanda, et al.
Published: (2026)
by: Auzina, Ilze Amanda, et al.
Published: (2026)
MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
by: Zhao, Weikang, et al.
Published: (2025)
by: Zhao, Weikang, et al.
Published: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
by: Tang, Wenjie, et al.
Published: (2026)
by: Tang, Wenjie, et al.
Published: (2026)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
by: Liang, Yongheng, et al.
Published: (2024)
by: Liang, Yongheng, et al.
Published: (2024)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
by: Cao, Shiyi, et al.
Published: (2025)
by: Cao, Shiyi, et al.
Published: (2025)
When to Continue Thinking: Adaptive Thinking Mode Switching for Efficient Reasoning
by: Zhang, Xiaoyun, et al.
Published: (2025)
by: Zhang, Xiaoyun, et al.
Published: (2025)
VinePPO: Refining Credit Assignment in RL Training of LLMs
by: Kazemnejad, Amirhossein, et al.
Published: (2024)
by: Kazemnejad, Amirhossein, et al.
Published: (2024)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
by: Tran, Hieu, et al.
Published: (2025)
by: Tran, Hieu, et al.
Published: (2025)
Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents
by: Yan, Sikuan, et al.
Published: (2026)
by: Yan, Sikuan, et al.
Published: (2026)
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents
by: Pang, Cong, et al.
Published: (2026)
by: Pang, Cong, et al.
Published: (2026)
Agent-Temporal Credit Assignment for Optimal Policy Preservation in Sparse Multi-Agent Reinforcement Learning
by: Kapoor, Aditya, et al.
Published: (2024)
by: Kapoor, Aditya, et al.
Published: (2024)
GuideLight: "Industrial Solution" Guidance for More Practical Traffic Signal Control Agents
by: Jiang, Haoyuan, et al.
Published: (2024)
by: Jiang, Haoyuan, et al.
Published: (2024)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
by: Chen, Yanjun, et al.
Published: (2026)
by: Chen, Yanjun, et al.
Published: (2026)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
by: Zhang, Naifan, et al.
Published: (2026)
by: Zhang, Naifan, et al.
Published: (2026)
Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control
by: Ju, Siwei, et al.
Published: (2026)
by: Ju, Siwei, et al.
Published: (2026)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
by: Lafuente-Mercado, Rodney
Published: (2026)
by: Lafuente-Mercado, Rodney
Published: (2026)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
by: Low, Siow Meng, et al.
Published: (2025)
by: Low, Siow Meng, et al.
Published: (2025)
Tree-based Credit Assignment for Multi-Agent Memory System
by: Mao, Marina, et al.
Published: (2026)
by: Mao, Marina, et al.
Published: (2026)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
by: Guo, Yiran, et al.
Published: (2025)
by: Guo, Yiran, et al.
Published: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
by: Ding, Fei, et al.
Published: (2026)
by: Ding, Fei, et al.
Published: (2026)
Challenges in Credit Assignment for Multi-Agent Reinforcement Learning in Open Agent Systems
by: Abadi, Alireza Saleh, et al.
Published: (2025)
by: Abadi, Alireza Saleh, et al.
Published: (2025)
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
by: Zhang, Yi-Kai, et al.
Published: (2026)
by: Zhang, Yi-Kai, et al.
Published: (2026)
EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents
by: Yuan, Zike, et al.
Published: (2026)
by: Yuan, Zike, et al.
Published: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
by: Khandoga, Mykola, et al.
Published: (2026)
by: Khandoga, Mykola, et al.
Published: (2026)
Variational Quantum Eigensolver for Classification in Credit Sales Risk
by: Wiśniewska, Joanna, et al.
Published: (2023)
by: Wiśniewska, Joanna, et al.
Published: (2023)
Regulating Credit Lines in the Presence of Fire‐Sale Externalities
by: JOSÉ E. GUTIÉRREZ
Published: (2026)
by: JOSÉ E. GUTIÉRREZ
Published: (2026)
RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents
by: Li, Mingchen, et al.
Published: (2026)
by: Li, Mingchen, et al.
Published: (2026)
Diffusion of Neuromodulators for Temporal Credit Assignment
by: Barretto-Bittar, João, et al.
Published: (2026)
by: Barretto-Bittar, João, et al.
Published: (2026)
In-Context Credit Assignment via the Core
by: Harris, Keegan, et al.
Published: (2026)
by: Harris, Keegan, et al.
Published: (2026)
Explainable Reinforcement Learning via a Causal World Model
by: Yu, Zhongwei, et al.
Published: (2023)
by: Yu, Zhongwei, et al.
Published: (2023)
Learning Causal Dynamics Models in Object-Oriented Environments
by: Yu, Zhongwei, et al.
Published: (2024)
by: Yu, Zhongwei, et al.
Published: (2024)
Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
by: Hua, Yun, et al.
Published: (2025)
by: Hua, Yun, et al.
Published: (2025)
Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment
by: Nagpal, Kartik, et al.
Published: (2025)
by: Nagpal, Kartik, et al.
Published: (2025)
Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning
by: Zhao, Xutong, et al.
Published: (2025)
by: Zhao, Xutong, et al.
Published: (2025)
Similar Items
-
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
by: Jian, Ai, et al.
Published: (2025) -
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
by: Jian, Ai, et al.
Published: (2026) -
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
by: Zheng, Binbin, et al.
Published: (2026) -
Hindsight Credit Assignment for Long-Horizon LLM Agents
by: Tan, Hui-Ze, et al.
Published: (2026) -
Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy
by: Zhang, Xiaoyun, et al.
Published: (2025)