Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Jiancong, Hou, Bojian, Wang, Zhanliang, Jin, Ruochen, Long, Qi, Su, Weijie J., Shen, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
par: Wang, Zhanliang, et autres
Publié: (2026)
par: Wang, Zhanliang, et autres
Publié: (2026)
Fine-Tuning Attention Modules Only: Enhancing Weight Disentanglement in Task Arithmetic
par: Jin, Ruochen, et autres
Publié: (2024)
par: Jin, Ruochen, et autres
Publié: (2024)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024)
par: Li, Ziniu, et autres
Publié: (2024)
Theoretical Tensions in RLHF: Reconciling Empirical Success with Inconsistencies in Social Choice Theory
par: Xiao, Jiancong, et autres
Publié: (2025)
par: Xiao, Jiancong, et autres
Publié: (2025)
Fine-Tuning is Fine, if Calibrated
par: Mai, Zheda, et autres
Publié: (2024)
par: Mai, Zheda, et autres
Publié: (2024)
Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning
par: Krishnan, Ranganath, et autres
Publié: (2024)
par: Krishnan, Ranganath, et autres
Publié: (2024)
Saliency-Aware Regularized Quantization Calibration for Large Language Models
par: Zhao, Yanlong, et autres
Publié: (2026)
par: Zhao, Yanlong, et autres
Publié: (2026)
Confidence Calibration in Large Language Models
par: Michael, Noam, et autres
Publié: (2026)
par: Michael, Noam, et autres
Publié: (2026)
Fair CCA for Fair Representation Learning: An ADNI Study
par: Hou, Bojian, et autres
Publié: (2025)
par: Hou, Bojian, et autres
Publié: (2025)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
par: Zeng, Yirong, et autres
Publié: (2025)
par: Zeng, Yirong, et autres
Publié: (2025)
Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models
par: Zhang, Longteng, et autres
Publié: (2026)
par: Zhang, Longteng, et autres
Publié: (2026)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
par: Wei, Quan, et autres
Publié: (2025)
par: Wei, Quan, et autres
Publié: (2025)
SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and Calibration
par: Shen, Yuanhao, et autres
Publié: (2024)
par: Shen, Yuanhao, et autres
Publié: (2024)
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
par: Hao, Sai, et autres
Publié: (2026)
par: Hao, Sai, et autres
Publié: (2026)
Reward Collapse in Aligning Large Language Models
par: Song, Ziang, et autres
Publié: (2023)
par: Song, Ziang, et autres
Publié: (2023)
Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach
par: Lu, Wei, et autres
Publié: (2025)
par: Lu, Wei, et autres
Publié: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
par: Chen, Michael K., et autres
Publié: (2025)
par: Chen, Michael K., et autres
Publié: (2025)
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)
par: Dabas, Mahavir, et autres
Publié: (2025)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2023)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
par: Oh, Changdae, et autres
Publié: (2023)
par: Oh, Changdae, et autres
Publié: (2023)
Automatic Calibration for Membership Inference Attack on Large Language Models
par: Zade, Saleh Zare, et autres
Publié: (2025)
par: Zade, Saleh Zare, et autres
Publié: (2025)
CLoQ: Enhancing Fine-Tuning of Quantized LLMs via Calibrated LoRA Initialization
par: Deng, Yanxia, et autres
Publié: (2025)
par: Deng, Yanxia, et autres
Publié: (2025)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
par: Kim, Gyuhak, et autres
Publié: (2025)
par: Kim, Gyuhak, et autres
Publié: (2025)
MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
par: Wang, Jason Z
Publié: (2026)
par: Wang, Jason Z
Publié: (2026)
Revisiting Uncertainty Estimation and Calibration of Large Language Models
par: Tao, Linwei, et autres
Publié: (2025)
par: Tao, Linwei, et autres
Publié: (2025)
Beware of Calibration Data for Pruning Large Language Models
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
On Calibration of Large Language Models: From Response To Capability
par: Yang, Sin-Han, et autres
Publié: (2026)
par: Yang, Sin-Han, et autres
Publié: (2026)
Calibrating Large Language Models Using Their Generations Only
par: Ulmer, Dennis, et autres
Publié: (2024)
par: Ulmer, Dennis, et autres
Publié: (2024)
On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization
par: Xiao, Jiancong, et autres
Publié: (2024)
par: Xiao, Jiancong, et autres
Publié: (2024)
Towards Fine-Tuning-Based Site Calibration for Knowledge-Guided Machine Learning: A Summary of Results
par: Zeng, Ruolei, et autres
Publié: (2025)
par: Zeng, Ruolei, et autres
Publié: (2025)
Scalable Utility-Aware Multiclass Calibration
par: Hegazy, Mahmoud, et autres
Publié: (2025)
par: Hegazy, Mahmoud, et autres
Publié: (2025)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
par: Chow, Yinlam, et autres
Publié: (2024)
par: Chow, Yinlam, et autres
Publié: (2024)
Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
par: Wang, Mengxuan, et autres
Publié: (2026)
par: Wang, Mengxuan, et autres
Publié: (2026)
Linearization Explains Fine-Tuning in Large Language Models
par: Afzal, Zahra Rahimi, et autres
Publié: (2026)
par: Afzal, Zahra Rahimi, et autres
Publié: (2026)
On the Entropy Calibration of Language Models
par: Cao, Steven, et autres
Publié: (2025)
par: Cao, Steven, et autres
Publié: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
par: Ye, Kai, et autres
Publié: (2025)
par: Ye, Kai, et autres
Publié: (2025)
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Self-Calibrated Tuning of Vision-Language Models for Out-of-Distribution Detection
par: Yu, Geng, et autres
Publié: (2024)
par: Yu, Geng, et autres
Publié: (2024)
The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks
par: Chen, Xiaoyi, et autres
Publié: (2023)
par: Chen, Xiaoyi, et autres
Publié: (2023)
Aligning Evaluation with Clinical Priorities: Calibration, Label Shift, and Error Costs
par: Flores, Gerardo A., et autres
Publié: (2025)
par: Flores, Gerardo A., et autres
Publié: (2025)
Documents similaires
-
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
par: Wang, Zhanliang, et autres
Publié: (2026) -
Fine-Tuning Attention Modules Only: Enhancing Weight Disentanglement in Task Arithmetic
par: Jin, Ruochen, et autres
Publié: (2024) -
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024) -
Theoretical Tensions in RLHF: Reconciling Empirical Success with Inconsistencies in Social Choice Theory
par: Xiao, Jiancong, et autres
Publié: (2025) -
Fine-Tuning is Fine, if Calibrated
par: Mai, Zheda, et autres
Publié: (2024)