Incentivizing Strong Reasoning from Weak Supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Yige, Xiao, Teng, Tao, Shuchang, Wang, Xue, Gao, Jinyang, Ding, Bolin, Xu, Bingbing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inference-time Alignment in Continuous Space
par: Yuan, Yige, et autres
Publié: (2025)
par: Yuan, Yige, et autres
Publié: (2025)
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
par: Wang, Jingchu, et autres
Publié: (2026)
par: Wang, Jingchu, et autres
Publié: (2026)
Fact-Level Confidence Calibration and Self-Correction
par: Yuan, Yige, et autres
Publié: (2024)
par: Yuan, Yige, et autres
Publié: (2024)
KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
Weak-to-Strong Reasoning
par: Yang, Yuqing, et autres
Publié: (2024)
par: Yang, Yuqing, et autres
Publié: (2024)
Multi-Personality Generation of LLMs at Decoding-time
par: Chen, Rongxin, et autres
Publié: (2025)
par: Chen, Rongxin, et autres
Publié: (2025)
How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
par: Cui, Yingqian, et autres
Publié: (2026)
par: Cui, Yingqian, et autres
Publié: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
par: Wen, Xumeng, et autres
Publié: (2025)
par: Wen, Xumeng, et autres
Publié: (2025)
Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning
par: Zhang, Xiaotian, et autres
Publié: (2025)
par: Zhang, Xiaotian, et autres
Publié: (2025)
Selective Weak-to-Strong Generalization
par: Lang, Hao, et autres
Publié: (2025)
par: Lang, Hao, et autres
Publié: (2025)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
Debate Helps Weak-to-Strong Generalization
par: Lang, Hao, et autres
Publié: (2025)
par: Lang, Hao, et autres
Publié: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Towards Anthropomorphic Conversational AI Part I: A Practical Framework
par: Wei, Fei, et autres
Publié: (2025)
par: Wei, Fei, et autres
Publié: (2025)
Training Agents with Weakly Supervised Feedback from Large Language Models
par: Gong, Dihong, et autres
Publié: (2024)
par: Gong, Dihong, et autres
Publié: (2024)
DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning
par: Chan, Chi-Min, et autres
Publié: (2026)
par: Chan, Chi-Min, et autres
Publié: (2026)
RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy Response
par: Luo, Junyu, et autres
Publié: (2024)
par: Luo, Junyu, et autres
Publié: (2024)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026)
par: Chen, Hao-Yuan
Publié: (2026)
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
par: Cheng, Xiaoxue, et autres
Publié: (2025)
par: Cheng, Xiaoxue, et autres
Publié: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
par: Peng, Miao, et autres
Publié: (2026)
par: Peng, Miao, et autres
Publié: (2026)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
par: Song, Feifan, et autres
Publié: (2025)
par: Song, Feifan, et autres
Publié: (2025)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
par: Kim, Kyuyoung, et autres
Publié: (2026)
par: Kim, Kyuyoung, et autres
Publié: (2026)
Concept Distillation from Strong to Weak Models via Hypotheses-to-Theories Prompting
par: Boateng, Emmanuel Aboah, et autres
Publié: (2024)
par: Boateng, Emmanuel Aboah, et autres
Publié: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
par: Lyu, Yougang, et autres
Publié: (2024)
par: Lyu, Yougang, et autres
Publié: (2024)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
par: DeepSeek-AI, et autres
Publié: (2025)
par: DeepSeek-AI, et autres
Publié: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
par: Xue, Xiangyuan, et autres
Publié: (2026)
par: Xue, Xiangyuan, et autres
Publié: (2026)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
par: Cai, Zhenyang, et autres
Publié: (2025)
par: Cai, Zhenyang, et autres
Publié: (2025)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
par: Wang, Qianyue, et autres
Publié: (2026)
par: Wang, Qianyue, et autres
Publié: (2026)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
par: Qin, Yulei, et autres
Publié: (2025)
par: Qin, Yulei, et autres
Publié: (2025)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
par: Yue, Yang, et autres
Publié: (2025)
par: Yue, Yang, et autres
Publié: (2025)
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
par: Zou, Deyu, et autres
Publié: (2025)
par: Zou, Deyu, et autres
Publié: (2025)
Bayesian WeakS-to-Strong from Text Classification to Generation
par: Cui, Ziyun, et autres
Publié: (2024)
par: Cui, Ziyun, et autres
Publié: (2024)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
MRG-R1: Reinforcement Learning for Clinically Aligned Medical Report Generation
par: Wang, Pengyu, et autres
Publié: (2025)
par: Wang, Pengyu, et autres
Publié: (2025)
CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation
par: Wang, Xintao, et autres
Publié: (2025)
par: Wang, Xintao, et autres
Publié: (2025)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
Documents similaires
-
Inference-time Alignment in Continuous Space
par: Yuan, Yige, et autres
Publié: (2025) -
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
par: Wang, Jingchu, et autres
Publié: (2026) -
Fact-Level Confidence Calibration and Self-Correction
par: Yuan, Yige, et autres
Publié: (2024) -
KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA
par: Chen, Zhuo, et autres
Publié: (2025) -
Weak-to-Strong Reasoning
par: Yang, Yuqing, et autres
Publié: (2024)