Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiawei, Liu, Jiacai, Fu, Yuqian, Li, Yingru, Wang, Xintao, Lin, Yuan, Yue, Yu, Zhang, Lin, Wang, Yang, Wang, Ke |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
par: Yu, Fei, et autres
Publié: (2025)
par: Yu, Fei, et autres
Publié: (2025)
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
par: Wang, Piaohong, et autres
Publié: (2025)
par: Wang, Piaohong, et autres
Publié: (2025)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
par: Wang, Zhenting, et autres
Publié: (2026)
par: Wang, Zhenting, et autres
Publié: (2026)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
par: Li, Yingru, et autres
Publié: (2026)
par: Li, Yingru, et autres
Publié: (2026)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
par: Fu, Yuqian, et autres
Publié: (2026)
par: Fu, Yuqian, et autres
Publié: (2026)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
par: Wang, Yuhui, et autres
Publié: (2026)
par: Wang, Yuhui, et autres
Publié: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
par: Song, Yuanyi, et autres
Publié: (2025)
par: Song, Yuanyi, et autres
Publié: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
par: Lin, Jingyang, et autres
Publié: (2026)
par: Lin, Jingyang, et autres
Publié: (2026)
Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
par: Yu, Fei, et autres
Publié: (2025)
par: Yu, Fei, et autres
Publié: (2025)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
par: Wang, Weixuan, et autres
Publié: (2025)
par: Wang, Weixuan, et autres
Publié: (2025)
Scaling Long-Horizon LLM Agent via Context-Folding
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
par: Xu, Wujiang, et autres
Publié: (2025)
par: Xu, Wujiang, et autres
Publié: (2025)
Elementary Analysis of Policy Gradient Methods
par: Liu, Jiacai, et autres
Publié: (2024)
par: Liu, Jiacai, et autres
Publié: (2024)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
par: Chen, Haolin, et autres
Publié: (2026)
par: Chen, Haolin, et autres
Publié: (2026)
ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents
par: Lu, Yuxing, et autres
Publié: (2026)
par: Lu, Yuxing, et autres
Publié: (2026)
COMAP: Co-Evolving World Models and Agent Policies for LLM Agents
par: Liu, Youwei, et autres
Publié: (2026)
par: Liu, Youwei, et autres
Publié: (2026)
ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning
par: Huang, Fan
Publié: (2026)
par: Huang, Fan
Publié: (2026)
PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents
par: Yang, Ke, et autres
Publié: (2026)
par: Yang, Ke, et autres
Publié: (2026)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
par: Jia, Haoxuan, et autres
Publié: (2026)
par: Jia, Haoxuan, et autres
Publié: (2026)
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
par: Chu, Zheng, et autres
Publié: (2026)
par: Chu, Zheng, et autres
Publié: (2026)
Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
par: Lin, Jingjie, et autres
Publié: (2026)
par: Lin, Jingjie, et autres
Publié: (2026)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
par: Hu, Yuyang, et autres
Publié: (2026)
par: Hu, Yuyang, et autres
Publié: (2026)
On the Convergence of Projected Policy Gradient for Any Constant Step Sizes
par: Liu, Jiacai, et autres
Publié: (2023)
par: Liu, Jiacai, et autres
Publié: (2023)
LLM$\times$MapReduce-V2: Entropy-Driven Convolutional Test-Time Scaling for Generating Long-Form Articles from Extremely Long Resources
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
par: Li, Chenliang, et autres
Publié: (2025)
par: Li, Chenliang, et autres
Publié: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
par: Wang, Jingxing, et autres
Publié: (2026)
par: Wang, Jingxing, et autres
Publié: (2026)
HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench
par: Wang, Yueyang, et autres
Publié: (2026)
par: Wang, Yueyang, et autres
Publié: (2026)
Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization
par: Lee, Gyuseok, et autres
Publié: (2026)
par: Lee, Gyuseok, et autres
Publié: (2026)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models
par: Fu, Yu, et autres
Publié: (2025)
par: Fu, Yu, et autres
Publié: (2025)
(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts
par: Wu, Minghao, et autres
Publié: (2024)
par: Wu, Minghao, et autres
Publié: (2024)
DictLLM: Harnessing Key-Value Data Structures with Large Language Models for Enhanced Medical Diagnostics
par: Guo, YiQiu, et autres
Publié: (2024)
par: Guo, YiQiu, et autres
Publié: (2024)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
par: Wang, Zehong, et autres
Publié: (2026)
par: Wang, Zehong, et autres
Publié: (2026)
Dual Hierarchical Dialogue Policy Learning for Legal Inquisitive Conversational Agents
par: Lin, Xubo, et autres
Publié: (2026)
par: Lin, Xubo, et autres
Publié: (2026)
Documents similaires
-
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
par: Li, Yingru, et autres
Publié: (2025) -
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
par: Li, Yingru, et autres
Publié: (2025) -
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
par: Yu, Fei, et autres
Publié: (2025) -
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
par: Wang, Piaohong, et autres
Publié: (2025) -
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
par: Wang, Zhenting, et autres
Publié: (2026)