Demystifying Reinforcement Learning in Agentic Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, Zhaochen, Yang, Ling, Zou, Jiaru, Yan, Shuicheng, Wang, Mengdi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
von: Yang, Ling, et al.
Veröffentlicht: (2025)
von: Yang, Ling, et al.
Veröffentlicht: (2025)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
von: Yang, Ling, et al.
Veröffentlicht: (2024)
von: Yang, Ling, et al.
Veröffentlicht: (2024)
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsing
von: Zou, Jiaru, et al.
Veröffentlicht: (2024)
von: Zou, Jiaru, et al.
Veröffentlicht: (2024)
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
von: Xu, Ran, et al.
Veröffentlicht: (2025)
von: Xu, Ran, et al.
Veröffentlicht: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
von: Ye, Hai, et al.
Veröffentlicht: (2024)
von: Ye, Hai, et al.
Veröffentlicht: (2024)
AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
von: Yang, Ling, et al.
Veröffentlicht: (2024)
von: Yang, Ling, et al.
Veröffentlicht: (2024)
Agentic Reasoning for Large Language Models
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
von: Mo, Fengran, et al.
Veröffentlicht: (2026)
von: Mo, Fengran, et al.
Veröffentlicht: (2026)
Agentic Reinforcement Learning for Search is Unsafe
von: Yang, Yushi, et al.
Veröffentlicht: (2025)
von: Yang, Yushi, et al.
Veröffentlicht: (2025)
CARL: Criticality-Aware Agentic Reinforcement Learning
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
von: Zhang, Chenchen
Veröffentlicht: (2026)
von: Zhang, Chenchen
Veröffentlicht: (2026)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems
von: Wang, Ling, et al.
Veröffentlicht: (2026)
von: Wang, Ling, et al.
Veröffentlicht: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2025)
Less Data Less Tokens: Multilingual Unification Learning for Efficient Test-Time Reasoning in LLMs
von: Chen, Kang, et al.
Veröffentlicht: (2025)
von: Chen, Kang, et al.
Veröffentlicht: (2025)
LogicPro: Improving Complex Logical Reasoning via Program-Guided Learning
von: Jiang, Jin, et al.
Veröffentlicht: (2024)
von: Jiang, Jin, et al.
Veröffentlicht: (2024)
Demystifying Long Chain-of-Thought Reasoning in LLMs
von: Yeo, Edward, et al.
Veröffentlicht: (2025)
von: Yeo, Edward, et al.
Veröffentlicht: (2025)
Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
von: Li, Alan, et al.
Veröffentlicht: (2025)
von: Li, Alan, et al.
Veröffentlicht: (2025)
Latent Collaboration in Multi-Agent Systems
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
von: Wang, Daoyu, et al.
Veröffentlicht: (2026)
von: Wang, Daoyu, et al.
Veröffentlicht: (2026)
MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
von: Zhang, Guibin, et al.
Veröffentlicht: (2025)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
Mem-W: Latent Memory-Native GUI Agents
von: Zhang, Guibin, et al.
Veröffentlicht: (2026)
von: Zhang, Guibin, et al.
Veröffentlicht: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
Beyond the Black Box: Demystifying Multi-Turn LLM Reasoning with VISTA
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference Optimization
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
von: Liu, Zhaochen, et al.
Veröffentlicht: (2026)
von: Liu, Zhaochen, et al.
Veröffentlicht: (2026)
DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models
von: Hong, Zhaochen, et al.
Veröffentlicht: (2026)
von: Hong, Zhaochen, et al.
Veröffentlicht: (2026)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
von: He, Jiashu, et al.
Veröffentlicht: (2025)
von: He, Jiashu, et al.
Veröffentlicht: (2025)
Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning
von: Wen, Cheng, et al.
Veröffentlicht: (2025)
von: Wen, Cheng, et al.
Veröffentlicht: (2025)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
von: Yang, Ling, et al.
Veröffentlicht: (2025) -
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
von: Zou, Jiaru, et al.
Veröffentlicht: (2025) -
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
von: Zou, Jiaru, et al.
Veröffentlicht: (2025) -
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
von: Yang, Ling, et al.
Veröffentlicht: (2024) -
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)