Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiangwei, Wang, Wei, Chen, Ken, Nimalsiri, Nanduni, Halgamuge, Saman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing
di: Qiu, Zhaoyuan, et al.
Pubblicazione: (2026)
di: Qiu, Zhaoyuan, et al.
Pubblicazione: (2026)
Rethinking Time Series Forecasting with LLMs via Nearest Neighbor Contrastive Learning
di: Bogahawatte, Jayanie, et al.
Pubblicazione: (2024)
di: Bogahawatte, Jayanie, et al.
Pubblicazione: (2024)
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
di: Hao, Shibo, et al.
Pubblicazione: (2024)
di: Hao, Shibo, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
On the Step Length Confounding in LLM Reasoning Data Selection
di: Wang, Bing, et al.
Pubblicazione: (2026)
di: Wang, Bing, et al.
Pubblicazione: (2026)
RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step
di: Luo, Xiaocheng, et al.
Pubblicazione: (2026)
di: Luo, Xiaocheng, et al.
Pubblicazione: (2026)
Graph-Eq: Discovering Mathematical Equations using Graph Generative Models
di: Ranasinghe, Nisal, et al.
Pubblicazione: (2025)
di: Ranasinghe, Nisal, et al.
Pubblicazione: (2025)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis
di: Chaliah, Ayoub Ben, et al.
Pubblicazione: (2025)
di: Chaliah, Ayoub Ben, et al.
Pubblicazione: (2025)
NILC: Discovering New Intents with LLM-assisted Clustering
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
di: Wang, Xiangyu, et al.
Pubblicazione: (2026)
di: Wang, Xiangyu, et al.
Pubblicazione: (2026)
The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning
di: Shin, Kwan Soo
Pubblicazione: (2026)
di: Shin, Kwan Soo
Pubblicazione: (2026)
Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
di: Wang, Qineng, et al.
Pubblicazione: (2024)
di: Wang, Qineng, et al.
Pubblicazione: (2024)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
di: Do, Heejin, et al.
Pubblicazione: (2025)
di: Do, Heejin, et al.
Pubblicazione: (2025)
Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
di: Han, Feijiang, et al.
Pubblicazione: (2025)
di: Han, Feijiang, et al.
Pubblicazione: (2025)
Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2025)
di: Wang, Teng, et al.
Pubblicazione: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Evaluating Generative AI-Enhanced Content: A Conceptual Framework Using Qualitative, Quantitative, and Mixed-Methods Approaches
di: Sarraf, Saman
Pubblicazione: (2024)
di: Sarraf, Saman
Pubblicazione: (2024)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
di: Lee, Kyumin, et al.
Pubblicazione: (2025)
di: Lee, Kyumin, et al.
Pubblicazione: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
di: Cao, Lang, et al.
Pubblicazione: (2024)
di: Cao, Lang, et al.
Pubblicazione: (2024)
Thought Anchors: Which LLM Reasoning Steps Matter?
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
Self-Discover: Large Language Models Self-Compose Reasoning Structures
di: Zhou, Pei, et al.
Pubblicazione: (2024)
di: Zhou, Pei, et al.
Pubblicazione: (2024)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
di: Ye, Fangda, et al.
Pubblicazione: (2026)
di: Ye, Fangda, et al.
Pubblicazione: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems
di: Yao, Bohan, et al.
Pubblicazione: (2025)
di: Yao, Bohan, et al.
Pubblicazione: (2025)
Discovering Multi-Scale Semantic Structure in Text Corpora Using Density-Based Trees and LLM Embeddings
di: Haschka, Thomas, et al.
Pubblicazione: (2025)
di: Haschka, Thomas, et al.
Pubblicazione: (2025)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
Step-level Value Preference Optimization for Mathematical Reasoning
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing
di: Qiu, Zhaoyuan, et al.
Pubblicazione: (2026) -
Rethinking Time Series Forecasting with LLMs via Nearest Neighbor Contrastive Learning
di: Bogahawatte, Jayanie, et al.
Pubblicazione: (2024) -
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
di: Hao, Shibo, et al.
Pubblicazione: (2024) -
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024) -
On the Step Length Confounding in LLM Reasoning Data Selection
di: Wang, Bing, et al.
Pubblicazione: (2026)