HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Zhicong, Lin, Zichuan, Jia, Wei, Tian, Changyuan, Ye, Deheng, Li, Peiguang, Jin, Li, Liu, Nayu, Xu, Guangluan, Feng, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning
par: Tian, Changyuan, et autres
Publié: (2025)
par: Tian, Changyuan, et autres
Publié: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026)
par: Tian, Changyuan, et autres
Publié: (2026)
ProAct: Agentic Lookahead in Interactive Environments
par: Yu, Yangbin, et autres
Publié: (2026)
par: Yu, Yangbin, et autres
Publié: (2026)
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
par: Yao, Jiashu, et autres
Publié: (2026)
par: Yao, Jiashu, et autres
Publié: (2026)
Learning Versatile Skills with Curriculum Masking
par: Tang, Yao, et autres
Publié: (2024)
par: Tang, Yao, et autres
Publié: (2024)
MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
par: Liu, Shengyuan, et autres
Publié: (2026)
par: Liu, Shengyuan, et autres
Publié: (2026)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning
par: Li, Keyu, et autres
Publié: (2021)
par: Li, Keyu, et autres
Publié: (2021)
Data Selection for Multi-turn Dialogue Instruction Tuning
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
CausalMACE: Causality Empowered Multi-Agents in Minecraft Cooperative Tasks
par: Chai, Qi, et autres
Publié: (2025)
par: Chai, Qi, et autres
Publié: (2025)
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
par: Zhang, Wenlin, et autres
Publié: (2025)
par: Zhang, Wenlin, et autres
Publié: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
par: Wu, Yuning, et autres
Publié: (2026)
par: Wu, Yuning, et autres
Publié: (2026)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
par: Wang, Ruiyi, et autres
Publié: (2025)
par: Wang, Ruiyi, et autres
Publié: (2025)
ES-Mem: Event Segmentation-Based Memory for Long-Term Dialogue Agents
par: Zou, Huhai, et autres
Publié: (2026)
par: Zou, Huhai, et autres
Publié: (2026)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
par: Lin, Zichuan, et autres
Publié: (2025)
par: Lin, Zichuan, et autres
Publié: (2025)
SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization
par: Wang, Zhengcheng, et autres
Publié: (2025)
par: Wang, Zhengcheng, et autres
Publié: (2025)
HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation
par: Zhao, He, et autres
Publié: (2026)
par: Zhao, He, et autres
Publié: (2026)
H$^2$R: Hierarchical Hindsight Reflection for Multi-Task LLM Agents
par: Ye, Shicheng, et autres
Publié: (2025)
par: Ye, Shicheng, et autres
Publié: (2025)
COT: A Generative Approach for Hate Speech Counter-Narratives via Contrastive Optimal Transport
par: Zhang, Linhao, et autres
Publié: (2024)
par: Zhang, Linhao, et autres
Publié: (2024)
HyCoRA: Hyper-Contrastive Role-Adaptive Learning for Role-Playing
par: Yang, Shihao, et autres
Publié: (2025)
par: Yang, Shihao, et autres
Publié: (2025)
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
par: Wei, Tong, et autres
Publié: (2025)
par: Wei, Tong, et autres
Publié: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
par: Lin, Zichuan, et autres
Publié: (2026)
par: Lin, Zichuan, et autres
Publié: (2026)
Hindsight PRIORs for Reward Learning from Human Preferences
par: Verma, Mudit, et autres
Publié: (2024)
par: Verma, Mudit, et autres
Publié: (2024)
PIPCFR: Pseudo-outcome Imputation with Post-treatment Variables for Individual Treatment Effect Estimation
par: Lin, Zichuan, et autres
Publié: (2025)
par: Lin, Zichuan, et autres
Publié: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
par: Xu, Zekun, et autres
Publié: (2025)
par: Xu, Zekun, et autres
Publié: (2025)
Multi-agent In-context Coordination via Decentralized Memory Retrieval
par: Jiang, Tao, et autres
Publié: (2025)
par: Jiang, Tao, et autres
Publié: (2025)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
par: Wei, Tong, et autres
Publié: (2025)
par: Wei, Tong, et autres
Publié: (2025)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
par: Hu, Zhexin, et autres
Publié: (2026)
par: Hu, Zhexin, et autres
Publié: (2026)
Revisiting Discrete Soft Actor-Critic
par: Zhou, Haibin, et autres
Publié: (2022)
par: Zhou, Haibin, et autres
Publié: (2022)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
par: Romio, Gabriel, et autres
Publié: (2026)
par: Romio, Gabriel, et autres
Publié: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
par: Shianifar, Jonaid, et autres
Publié: (2026)
par: Shianifar, Jonaid, et autres
Publié: (2026)
AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
par: Zhao, Haotian, et autres
Publié: (2026)
par: Zhao, Haotian, et autres
Publié: (2026)
Debiased Model-based Representations for Sample-efficient Continuous Control
par: Lyu, Jiafei, et autres
Publié: (2026)
par: Lyu, Jiafei, et autres
Publié: (2026)
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
par: Yan, Mengbei, et autres
Publié: (2026)
par: Yan, Mengbei, et autres
Publié: (2026)
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
par: Xu, Peiran, et autres
Publié: (2025)
par: Xu, Peiran, et autres
Publié: (2025)
Verifiable Process Rewards for Agentic Reasoning
par: Yuan, Huining, et autres
Publié: (2026)
par: Yuan, Huining, et autres
Publié: (2026)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Documents similaires
-
Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning
par: Tian, Changyuan, et autres
Publié: (2025) -
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026) -
ProAct: Agentic Lookahead in Interactive Environments
par: Yu, Yangbin, et autres
Publié: (2026) -
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
par: Yao, Jiashu, et autres
Publié: (2026) -
Learning Versatile Skills with Curriculum Masking
par: Tang, Yao, et autres
Publié: (2024)