Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Williams, Jonathan, Tureci, Esin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reasoning with Latent Thoughts: On the Power of Looped Transformers
por: Saunshi, Nikunj, et al.
Publicado: (2025)
por: Saunshi, Nikunj, et al.
Publicado: (2025)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models
por: Zhou, Zhanke, et al.
Publicado: (2025)
por: Zhou, Zhanke, et al.
Publicado: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026)
por: Rezaei, Mohammad, et al.
Publicado: (2026)
Personalized Generative Models for Contextual Debiasing
por: Liang, Xinran, et al.
Publicado: (2026)
por: Liang, Xinran, et al.
Publicado: (2026)
Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models
por: Yang, Xiao-Wen, et al.
Publicado: (2026)
por: Yang, Xiao-Wen, et al.
Publicado: (2026)
Latent Chain-of-Thought Improves Structured-Data Transformers
por: Dudley, Carson, et al.
Publicado: (2026)
por: Dudley, Carson, et al.
Publicado: (2026)
Reasoning to Learn from Latent Thoughts
por: Ruan, Yangjun, et al.
Publicado: (2025)
por: Ruan, Yangjun, et al.
Publicado: (2025)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
por: Wu, Junda, et al.
Publicado: (2025)
por: Wu, Junda, et al.
Publicado: (2025)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
por: Xiong, Xiqiao, et al.
Publicado: (2025)
por: Xiong, Xiqiao, et al.
Publicado: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
por: Wang, Guanghan, et al.
Publicado: (2025)
por: Wang, Guanghan, et al.
Publicado: (2025)
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
por: Chen, Haolin, et al.
Publicado: (2024)
por: Chen, Haolin, et al.
Publicado: (2024)
Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration
por: Zhong, Shuzhang, et al.
Publicado: (2026)
por: Zhong, Shuzhang, et al.
Publicado: (2026)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
Reasoning with Latent Tokens in Diffusion Language Models
por: He, Andre, et al.
Publicado: (2026)
por: He, Andre, et al.
Publicado: (2026)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
por: Zabounidis, Renos, et al.
Publicado: (2025)
por: Zabounidis, Renos, et al.
Publicado: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
por: Ye, Jiacheng, et al.
Publicado: (2024)
por: Ye, Jiacheng, et al.
Publicado: (2024)
Inference-Time Rethinking with Latent Thought Vectors for Math Reasoning
por: Kong, Deqian, et al.
Publicado: (2026)
por: Kong, Deqian, et al.
Publicado: (2026)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
por: Yu, Zhuohao, et al.
Publicado: (2024)
por: Yu, Zhuohao, et al.
Publicado: (2024)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
por: Setlur, Amrith, et al.
Publicado: (2024)
por: Setlur, Amrith, et al.
Publicado: (2024)
Modeling Complex Disease Trajectories using Deep Generative Models with Semi-Supervised Latent Processes
por: Trottet, Cécile, et al.
Publicado: (2023)
por: Trottet, Cécile, et al.
Publicado: (2023)
Improve Mathematical Reasoning in Language Models by Automated Process Supervision
por: Luo, Liangchen, et al.
Publicado: (2024)
por: Luo, Liangchen, et al.
Publicado: (2024)
Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing
por: Reichman, Benjamin, et al.
Publicado: (2026)
por: Reichman, Benjamin, et al.
Publicado: (2026)
Feedback Loops With Language Models Drive In-Context Reward Hacking
por: Pan, Alexander, et al.
Publicado: (2024)
por: Pan, Alexander, et al.
Publicado: (2024)
The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models
por: Welch, Robert, et al.
Publicado: (2026)
por: Welch, Robert, et al.
Publicado: (2026)
Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning
por: Lyu, Chengqi, et al.
Publicado: (2025)
por: Lyu, Chengqi, et al.
Publicado: (2025)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
por: Chen, Changyu, et al.
Publicado: (2024)
por: Chen, Changyu, et al.
Publicado: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
por: Zhang, Zhenru, et al.
Publicado: (2025)
por: Zhang, Zhenru, et al.
Publicado: (2025)
Intra-Trajectory Consistency for Reward Modeling
por: Zhou, Chaoyang, et al.
Publicado: (2025)
por: Zhou, Chaoyang, et al.
Publicado: (2025)
Unsupervised Process Reward Models
por: Gadetsky, Artyom, et al.
Publicado: (2026)
por: Gadetsky, Artyom, et al.
Publicado: (2026)
Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning
por: Yu, Qifan, et al.
Publicado: (2025)
por: Yu, Qifan, et al.
Publicado: (2025)
A Mechanistic Analysis of Looped Reasoning Language Models
por: Blayney, Hugh, et al.
Publicado: (2026)
por: Blayney, Hugh, et al.
Publicado: (2026)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
por: Zeng, Thomas, et al.
Publicado: (2025)
por: Zeng, Thomas, et al.
Publicado: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
por: Cao, Qi, et al.
Publicado: (2025)
por: Cao, Qi, et al.
Publicado: (2025)
Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search
por: Alrashedy, Kamel, et al.
Publicado: (2025)
por: Alrashedy, Kamel, et al.
Publicado: (2025)
Trajectory Anomaly Detection with Language Models
por: Mbuya, Jonathan, et al.
Publicado: (2024)
por: Mbuya, Jonathan, et al.
Publicado: (2024)
Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward
por: Chen, Jianlong, et al.
Publicado: (2026)
por: Chen, Jianlong, et al.
Publicado: (2026)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
por: Tanmay, Kumar, et al.
Publicado: (2025)
por: Tanmay, Kumar, et al.
Publicado: (2025)
LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models
por: Park, Taekhyun, et al.
Publicado: (2026)
por: Park, Taekhyun, et al.
Publicado: (2026)
Ejemplares similares
-
Reasoning with Latent Thoughts: On the Power of Looped Transformers
por: Saunshi, Nikunj, et al.
Publicado: (2025) -
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
por: Zhang, Zheng, et al.
Publicado: (2025) -
Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models
por: Zhou, Zhanke, et al.
Publicado: (2025) -
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026) -
Personalized Generative Models for Contextual Debiasing
por: Liang, Xinran, et al.
Publicado: (2026)