Exploring Reasoning Reward Model for Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Kaixuan, Feng, Kaituo, Zhang, Manyuan, Peng, Tianshuo, Li, Zhixun, Jiang, Yilei, Chen, Shuang, Pei, Peng, Cai, Xunliang, Yue, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
di: Zhang, Kaituo, et al.
Pubblicazione: (2026)
di: Zhang, Kaituo, et al.
Pubblicazione: (2026)
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
di: Li, Yewen, et al.
Pubblicazione: (2026)
di: Li, Yewen, et al.
Pubblicazione: (2026)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
di: Peng, Miao, et al.
Pubblicazione: (2025)
di: Peng, Miao, et al.
Pubblicazione: (2025)
OpenGame: Open Agentic Coding for Games
di: Jiang, Yilei, et al.
Pubblicazione: (2026)
di: Jiang, Yilei, et al.
Pubblicazione: (2026)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
di: Jiang, Jin, et al.
Pubblicazione: (2025)
di: Jiang, Jin, et al.
Pubblicazione: (2025)
LLMs can Find Mathematical Reasoning Mistakes by Pedagogical Chain-of-Thought
di: Jiang, Zhuoxuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhuoxuan, et al.
Pubblicazione: (2024)
S^3cMath: Spontaneous Step-level Self-correction Makes Large Language Models Better Mathematical Reasoners
di: Yan, Yuchen, et al.
Pubblicazione: (2024)
di: Yan, Yuchen, et al.
Pubblicazione: (2024)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
di: Liu, Yule, et al.
Pubblicazione: (2025)
di: Liu, Yule, et al.
Pubblicazione: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
Look Before You Leap: Autonomous Exploration for LLM Agents
di: Ye, Ziang, et al.
Pubblicazione: (2026)
di: Ye, Ziang, et al.
Pubblicazione: (2026)
All Language Models Large and Small
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
Learning to Self-Verify Makes Language Models Better Reasoners
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
di: Liu, Junlin, et al.
Pubblicazione: (2026)
di: Liu, Junlin, et al.
Pubblicazione: (2026)
Exploring and Controlling Diversity in LLM-Agent Conversation
di: Chu, KuanChao, et al.
Pubblicazione: (2024)
di: Chu, KuanChao, et al.
Pubblicazione: (2024)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
di: Chen, Bin, et al.
Pubblicazione: (2025)
di: Chen, Bin, et al.
Pubblicazione: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
di: Peng, Hao, et al.
Pubblicazione: (2026)
di: Peng, Hao, et al.
Pubblicazione: (2026)
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
di: Wang, Jianing, et al.
Pubblicazione: (2026)
di: Wang, Jianing, et al.
Pubblicazione: (2026)
Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series
di: Cai, Wenrui, et al.
Pubblicazione: (2025)
di: Cai, Wenrui, et al.
Pubblicazione: (2025)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
MindScope: Exploring cognitive biases in large language models through Multi-Agent Systems
di: Xie, Zhentao, et al.
Pubblicazione: (2024)
di: Xie, Zhentao, et al.
Pubblicazione: (2024)
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
di: Yang, Yiliu, et al.
Pubblicazione: (2025)
di: Yang, Yiliu, et al.
Pubblicazione: (2025)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
di: Yan, Siyu, et al.
Pubblicazione: (2025)
di: Yan, Siyu, et al.
Pubblicazione: (2025)
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
When to Continue Thinking: Adaptive Thinking Mode Switching for Efficient Reasoning
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
di: Peng, Hao, et al.
Pubblicazione: (2025)
di: Peng, Hao, et al.
Pubblicazione: (2025)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
di: Men, Tianyi, et al.
Pubblicazione: (2025)
di: Men, Tianyi, et al.
Pubblicazione: (2025)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework
di: Jiang, Zihao, et al.
Pubblicazione: (2025)
di: Jiang, Zihao, et al.
Pubblicazione: (2025)
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
di: Liang, Tian, et al.
Pubblicazione: (2025)
di: Liang, Tian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025) -
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025) -
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
di: Zhang, Kaituo, et al.
Pubblicazione: (2026) -
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
di: Li, Yewen, et al.
Pubblicazione: (2026) -
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)