HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Zhicong, Lin, Zichuan, Jia, Wei, Tian, Changyuan, Ye, Deheng, Li, Peiguang, Jin, Li, Liu, Nayu, Xu, Guangluan, Feng, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning
von: Tian, Changyuan, et al.
Veröffentlicht: (2025)
von: Tian, Changyuan, et al.
Veröffentlicht: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
von: Tian, Changyuan, et al.
Veröffentlicht: (2026)
von: Tian, Changyuan, et al.
Veröffentlicht: (2026)
ProAct: Agentic Lookahead in Interactive Environments
von: Yu, Yangbin, et al.
Veröffentlicht: (2026)
von: Yu, Yangbin, et al.
Veröffentlicht: (2026)
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
von: Yao, Jiashu, et al.
Veröffentlicht: (2026)
von: Yao, Jiashu, et al.
Veröffentlicht: (2026)
Learning Versatile Skills with Curriculum Masking
von: Tang, Yao, et al.
Veröffentlicht: (2024)
von: Tang, Yao, et al.
Veröffentlicht: (2024)
MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning
von: Li, Keyu, et al.
Veröffentlicht: (2021)
von: Li, Keyu, et al.
Veröffentlicht: (2021)
Data Selection for Multi-turn Dialogue Instruction Tuning
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
CausalMACE: Causality Empowered Multi-Agents in Minecraft Cooperative Tasks
von: Chai, Qi, et al.
Veröffentlicht: (2025)
von: Chai, Qi, et al.
Veröffentlicht: (2025)
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
von: Zhang, Wenlin, et al.
Veröffentlicht: (2025)
von: Zhang, Wenlin, et al.
Veröffentlicht: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
ES-Mem: Event Segmentation-Based Memory for Long-Term Dialogue Agents
von: Zou, Huhai, et al.
Veröffentlicht: (2026)
von: Zou, Huhai, et al.
Veröffentlicht: (2026)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization
von: Wang, Zhengcheng, et al.
Veröffentlicht: (2025)
von: Wang, Zhengcheng, et al.
Veröffentlicht: (2025)
HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation
von: Zhao, He, et al.
Veröffentlicht: (2026)
von: Zhao, He, et al.
Veröffentlicht: (2026)
H$^2$R: Hierarchical Hindsight Reflection for Multi-Task LLM Agents
von: Ye, Shicheng, et al.
Veröffentlicht: (2025)
von: Ye, Shicheng, et al.
Veröffentlicht: (2025)
COT: A Generative Approach for Hate Speech Counter-Narratives via Contrastive Optimal Transport
von: Zhang, Linhao, et al.
Veröffentlicht: (2024)
von: Zhang, Linhao, et al.
Veröffentlicht: (2024)
HyCoRA: Hyper-Contrastive Role-Adaptive Learning for Role-Playing
von: Yang, Shihao, et al.
Veröffentlicht: (2025)
von: Yang, Shihao, et al.
Veröffentlicht: (2025)
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
von: Wei, Tong, et al.
Veröffentlicht: (2025)
von: Wei, Tong, et al.
Veröffentlicht: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
Hindsight PRIORs for Reward Learning from Human Preferences
von: Verma, Mudit, et al.
Veröffentlicht: (2024)
von: Verma, Mudit, et al.
Veröffentlicht: (2024)
PIPCFR: Pseudo-outcome Imputation with Post-treatment Variables for Individual Treatment Effect Estimation
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
von: Xu, Zekun, et al.
Veröffentlicht: (2025)
von: Xu, Zekun, et al.
Veröffentlicht: (2025)
Multi-agent In-context Coordination via Decentralized Memory Retrieval
von: Jiang, Tao, et al.
Veröffentlicht: (2025)
von: Jiang, Tao, et al.
Veröffentlicht: (2025)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
von: Wei, Tong, et al.
Veröffentlicht: (2025)
von: Wei, Tong, et al.
Veröffentlicht: (2025)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
von: Hu, Zhexin, et al.
Veröffentlicht: (2026)
von: Hu, Zhexin, et al.
Veröffentlicht: (2026)
Revisiting Discrete Soft Actor-Critic
von: Zhou, Haibin, et al.
Veröffentlicht: (2022)
von: Zhou, Haibin, et al.
Veröffentlicht: (2022)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
von: Romio, Gabriel, et al.
Veröffentlicht: (2026)
von: Romio, Gabriel, et al.
Veröffentlicht: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
von: Li, Xiaozhe, et al.
Veröffentlicht: (2026)
von: Li, Xiaozhe, et al.
Veröffentlicht: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
von: Zhao, Haotian, et al.
Veröffentlicht: (2026)
von: Zhao, Haotian, et al.
Veröffentlicht: (2026)
Debiased Model-based Representations for Sample-efficient Continuous Control
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
von: Lyu, Jiafei, et al.
Veröffentlicht: (2026)
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
von: Yan, Mengbei, et al.
Veröffentlicht: (2026)
von: Yan, Mengbei, et al.
Veröffentlicht: (2026)
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
von: Xu, Peiran, et al.
Veröffentlicht: (2025)
von: Xu, Peiran, et al.
Veröffentlicht: (2025)
Verifiable Process Rewards for Agentic Reasoning
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning
von: Tian, Changyuan, et al.
Veröffentlicht: (2025) -
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
von: Tian, Changyuan, et al.
Veröffentlicht: (2026) -
ProAct: Agentic Lookahead in Interactive Environments
von: Yu, Yangbin, et al.
Veröffentlicht: (2026) -
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
von: Yao, Jiashu, et al.
Veröffentlicht: (2026) -
Learning Versatile Skills with Curriculum Masking
von: Tang, Yao, et al.
Veröffentlicht: (2024)