CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Shuozhe, Cao, Jincheng, Hu, Bodun, Mokhtari, Aryan, Liu, Leqi, Zhang, Amy |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Curriculum Learning-Guided Progressive Distillation in Large Language Models
par: Cao, Jincheng, et autres
Publié: (2026)
par: Cao, Jincheng, et autres
Publié: (2026)
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
par: Pathak, Manas, et autres
Publié: (2026)
par: Pathak, Manas, et autres
Publié: (2026)
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
par: Zhou, Ruiyang, et autres
Publié: (2025)
par: Zhou, Ruiyang, et autres
Publié: (2025)
A Learnable Wavelet Transformer for Long-Short Equity Trading and Risk-Adjusted Return Optimization
par: Li, Shuozhe, et autres
Publié: (2026)
par: Li, Shuozhe, et autres
Publié: (2026)
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
par: Liang, Jing, et autres
Publié: (2025)
par: Liang, Jing, et autres
Publié: (2025)
Vanishing Gradients in Reinforcement Finetuning of Language Models
par: Razin, Noam, et autres
Publié: (2023)
par: Razin, Noam, et autres
Publié: (2023)
Large Language Models to Diffusion Finetuning
par: Cetin, Edoardo, et autres
Publié: (2025)
par: Cetin, Edoardo, et autres
Publié: (2025)
Differentially Private Zeroth-Order Methods for Scalable Large Language Model Finetuning
par: Liu, Z, et autres
Publié: (2024)
par: Liu, Z, et autres
Publié: (2024)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
par: Stengel-Eskin, Elias, et autres
Publié: (2024)
par: Stengel-Eskin, Elias, et autres
Publié: (2024)
Prompting Fairness: Integrating Causality to Debias Large Language Models
par: Li, Jingling, et autres
Publié: (2024)
par: Li, Jingling, et autres
Publié: (2024)
Transfer Learning of Tabular Data by Finetuning Large Language Models
par: Rabbani, Shourav B., et autres
Publié: (2025)
par: Rabbani, Shourav B., et autres
Publié: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Personalized Language Modeling from Personalized Human Feedback
par: Li, Xinyu, et autres
Publié: (2024)
par: Li, Xinyu, et autres
Publié: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
par: Zhang, Andi, et autres
Publié: (2024)
par: Zhang, Andi, et autres
Publié: (2024)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
Early Stopping for Large Reasoning Models via Confidence Dynamics
par: Hosseini, Parsa, et autres
Publié: (2026)
par: Hosseini, Parsa, et autres
Publié: (2026)
Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models
par: Bello, Femi, et autres
Publié: (2025)
par: Bello, Femi, et autres
Publié: (2025)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
par: Kumar, Abhishek, et autres
Publié: (2024)
par: Kumar, Abhishek, et autres
Publié: (2024)
Learning Robust Reasoning through Guided Adversarial Self-Play
par: Li, Shuozhe, et autres
Publié: (2026)
par: Li, Shuozhe, et autres
Publié: (2026)
Advancing Reasoning in Large Language Models: Promising Methods and Approaches
par: Patil, Avinash, et autres
Publié: (2025)
par: Patil, Avinash, et autres
Publié: (2025)
QOG:Question and Options Generation based on Language Model
par: Zhou, Jincheng
Publié: (2024)
par: Zhou, Jincheng
Publié: (2024)
Large Language Models aren't all that you need
par: Holla, Kiran Voderhobli, et autres
Publié: (2024)
par: Holla, Kiran Voderhobli, et autres
Publié: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
par: Wang, Yiping, et autres
Publié: (2025)
par: Wang, Yiping, et autres
Publié: (2025)
In-Context Learning with Transformers: Softmax Attention Adapts to Function Lipschitzness
par: Collins, Liam, et autres
Publié: (2024)
par: Collins, Liam, et autres
Publié: (2024)
An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models
par: Bhatt, Gantavya, et autres
Publié: (2024)
par: Bhatt, Gantavya, et autres
Publié: (2024)
Confidence-Modulated Speculative Decoding for Large Language Models
par: Sen, Jaydip, et autres
Publié: (2025)
par: Sen, Jaydip, et autres
Publié: (2025)
ReFT: Representation Finetuning for Language Models
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
par: Wang, Yongxin, et autres
Publié: (2025)
par: Wang, Yongxin, et autres
Publié: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Delta Activations: A Representation for Finetuned Large Language Models
par: Xu, Zhiqiu, et autres
Publié: (2025)
par: Xu, Zhiqiu, et autres
Publié: (2025)
Graph-based Confidence Calibration for Large Language Models
par: Li, Yukun, et autres
Publié: (2024)
par: Li, Yukun, et autres
Publié: (2024)
An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning
par: Xu, Haoran, et autres
Publié: (2025)
par: Xu, Haoran, et autres
Publié: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Small or Large? Zero-Shot or Finetuned? Guiding Language Model Choice for Specialized Applications in Healthcare
par: Gondara, Lovedeep, et autres
Publié: (2025)
par: Gondara, Lovedeep, et autres
Publié: (2025)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
par: Yeh, Cheng-Kai, et autres
Publié: (2025)
par: Yeh, Cheng-Kai, et autres
Publié: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
par: Yuan, Hui, et autres
Publié: (2024)
par: Yuan, Hui, et autres
Publié: (2024)
Large Language Model Confidence Estimation via Black-Box Access
par: Pedapati, Tejaswini, et autres
Publié: (2024)
par: Pedapati, Tejaswini, et autres
Publié: (2024)
AdaptiveStep: Automatically Dividing Reasoning Step through Model Confidence
par: Liu, Yuliang, et autres
Publié: (2025)
par: Liu, Yuliang, et autres
Publié: (2025)
Documents similaires
-
Curriculum Learning-Guided Progressive Distillation in Large Language Models
par: Cao, Jincheng, et autres
Publié: (2026) -
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
par: Pathak, Manas, et autres
Publié: (2026) -
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
par: Zhou, Ruiyang, et autres
Publié: (2025) -
A Learnable Wavelet Transformer for Long-Short Equity Trading and Risk-Adjusted Return Optimization
par: Li, Shuozhe, et autres
Publié: (2026) -
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
par: Liang, Jing, et autres
Publié: (2025)