Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Peiyang, Chen, Zhirui, Wang, Xi, Liang, Di, Li, Youru, Cai, Zhi, Ye, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing
par: Jiao, Fangkai, et autres
Publié: (2024)
par: Jiao, Fangkai, et autres
Publié: (2024)
Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
par: Liu, Peiyang, et autres
Publié: (2026)
par: Liu, Peiyang, et autres
Publié: (2026)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
Interpretable Contrastive Monte Carlo Tree Search Reasoning
par: Gao, Zitian, et autres
Publié: (2024)
par: Gao, Zitian, et autres
Publié: (2024)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
par: Cheng, Siyuan, et autres
Publié: (2026)
par: Cheng, Siyuan, et autres
Publié: (2026)
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search
par: Liu, Max, et autres
Publié: (2024)
par: Liu, Max, et autres
Publié: (2024)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
Large Language Models are Contrastive Reasoners
par: Yao, Liang
Publié: (2024)
par: Yao, Liang
Publié: (2024)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus
par: Jindal, Ishan, et autres
Publié: (2026)
par: Jindal, Ishan, et autres
Publié: (2026)
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
par: Du, Yuwen, et autres
Publié: (2026)
par: Du, Yuwen, et autres
Publié: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
par: Chen, Mingyang, et autres
Publié: (2025)
par: Chen, Mingyang, et autres
Publié: (2025)
Retrieval Augmented Fact Verification by Synthesizing Contrastive Arguments
par: Yue, Zhenrui, et autres
Publié: (2024)
par: Yue, Zhenrui, et autres
Publié: (2024)
From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Training Retrieval-Augmented Generation Agents
par: Li, Muzhi, et autres
Publié: (2025)
par: Li, Muzhi, et autres
Publié: (2025)
Large Language Model Reasoning Failures
par: Song, Peiyang, et autres
Publié: (2026)
par: Song, Peiyang, et autres
Publié: (2026)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
par: Kim, Kyuyoung, et autres
Publié: (2026)
par: Kim, Kyuyoung, et autres
Publié: (2026)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
par: Guan, Weixin, et autres
Publié: (2026)
par: Guan, Weixin, et autres
Publié: (2026)
Paths of A Million People: Extracting Life Trajectories from Wikipedia
par: Zhang, Ying, et autres
Publié: (2024)
par: Zhang, Ying, et autres
Publié: (2024)
Emergent Search and Backtracking in Latent Reasoning Models
par: Cui, Jasmine, et autres
Publié: (2026)
par: Cui, Jasmine, et autres
Publié: (2026)
Toward Structured Knowledge Reasoning: Contrastive Retrieval-Augmented Generation on Experience
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
par: Luo, Haozheng, et autres
Publié: (2026)
par: Luo, Haozheng, et autres
Publié: (2026)
Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective
par: Liu, Junnan, et autres
Publié: (2025)
par: Liu, Junnan, et autres
Publié: (2025)
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
par: Wan, Guangya, et autres
Publié: (2024)
par: Wan, Guangya, et autres
Publié: (2024)
In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models
par: Han, Pengrui, et autres
Publié: (2024)
par: Han, Pengrui, et autres
Publié: (2024)
Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
par: Lu, Junjie, et autres
Publié: (2025)
par: Lu, Junjie, et autres
Publié: (2025)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning
par: Lu, Ximing, et autres
Publié: (2025)
par: Lu, Ximing, et autres
Publié: (2025)
On Path to Multimodal Historical Reasoning: HistBench and HistAgent
par: Qiu, Jiahao, et autres
Publié: (2025)
par: Qiu, Jiahao, et autres
Publié: (2025)
UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web
par: Yan, Yibo, et autres
Publié: (2023)
par: Yan, Yibo, et autres
Publié: (2023)
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
par: Cheng, Sitao, et autres
Publié: (2025)
par: Cheng, Sitao, et autres
Publié: (2025)
R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
par: Chen, Zhuokun, et autres
Publié: (2025)
par: Chen, Zhuokun, et autres
Publié: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
par: Shen, Maohao, et autres
Publié: (2025)
par: Shen, Maohao, et autres
Publié: (2025)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
par: Shi, Yaorui, et autres
Publié: (2025)
par: Shi, Yaorui, et autres
Publié: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
par: Shen, Wei, et autres
Publié: (2024)
par: Shen, Wei, et autres
Publié: (2024)
Controlling Thinking Speed in Reasoning Models
par: Lin, Zhengkai, et autres
Publié: (2025)
par: Lin, Zhengkai, et autres
Publié: (2025)
ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation
par: Wu, Peiyang, et autres
Publié: (2024)
par: Wu, Peiyang, et autres
Publié: (2024)
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
par: Liang, Haijian, et autres
Publié: (2026)
par: Liang, Haijian, et autres
Publié: (2026)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Documents similaires
-
Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing
par: Jiao, Fangkai, et autres
Publié: (2024) -
Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
par: Liu, Peiyang, et autres
Publié: (2026) -
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
par: Chia, Yew Ken, et autres
Publié: (2024) -
Interpretable Contrastive Monte Carlo Tree Search Reasoning
par: Gao, Zitian, et autres
Publié: (2024) -
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
par: Cheng, Siyuan, et autres
Publié: (2026)