Task Calibration: Calibrating Large Language Models on Inference Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yingjie, Luo, Yun, Xie, Xiaotian, Zhang, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?
por: Khurana, Urja, et al.
Publicado: (2024)
por: Khurana, Urja, et al.
Publicado: (2024)
Calibrating Large Language Models with Sample Consistency
por: Lyu, Qing, et al.
Publicado: (2024)
por: Lyu, Qing, et al.
Publicado: (2024)
Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models
por: Moore, Kyle, et al.
Publicado: (2025)
por: Moore, Kyle, et al.
Publicado: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
por: Shao, Wenqi, et al.
Publicado: (2023)
por: Shao, Wenqi, et al.
Publicado: (2023)
Calibrating Large Language Models Using Their Generations Only
por: Ulmer, Dennis, et al.
Publicado: (2024)
por: Ulmer, Dennis, et al.
Publicado: (2024)
Calibrating the Confidence of Large Language Models by Eliciting Fidelity
por: Zhang, Mozhi, et al.
Publicado: (2024)
por: Zhang, Mozhi, et al.
Publicado: (2024)
Labels have Human Values: Value Calibration of Subjective Tasks
por: Parappan, Mohammed Fayiz, et al.
Publicado: (2026)
por: Parappan, Mohammed Fayiz, et al.
Publicado: (2026)
Calibrating Reasoning in Language Models with Internal Consistency
por: Xie, Zhihui, et al.
Publicado: (2024)
por: Xie, Zhihui, et al.
Publicado: (2024)
Task-Aware Calibration: Provably Optimal Decoding in LLMs
por: Tomov, Tim, et al.
Publicado: (2026)
por: Tomov, Tim, et al.
Publicado: (2026)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
por: Fang, Ke, et al.
Publicado: (2025)
por: Fang, Ke, et al.
Publicado: (2025)
On Calibration of Large Language Models: From Response To Capability
por: Yang, Sin-Han, et al.
Publicado: (2026)
por: Yang, Sin-Han, et al.
Publicado: (2026)
Iterative Structured Pruning for Large Language Models with Multi-Domain Calibration
por: Wu, Guangxin, et al.
Publicado: (2026)
por: Wu, Guangxin, et al.
Publicado: (2026)
Beware of Calibration Data for Pruning Large Language Models
por: Ji, Yixin, et al.
Publicado: (2024)
por: Ji, Yixin, et al.
Publicado: (2024)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2026)
por: Xiao, Wenyi, et al.
Publicado: (2026)
Calibrating Verbalized Probabilities for Large Language Models
por: Wang, Cheng, et al.
Publicado: (2024)
por: Wang, Cheng, et al.
Publicado: (2024)
Calibration of Large Language Models on Code Summarization
por: Virk, Yuvraj, et al.
Publicado: (2024)
por: Virk, Yuvraj, et al.
Publicado: (2024)
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023)
por: Shen, Yongliang, et al.
Publicado: (2023)
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Geometry-Calibrated Conformal Abstention for Language Models
por: Xu, Rui, et al.
Publicado: (2026)
por: Xu, Rui, et al.
Publicado: (2026)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
por: Xu, Liuchang, et al.
Publicado: (2024)
por: Xu, Liuchang, et al.
Publicado: (2024)
SEAL: Steerable Reasoning Calibration of Large Language Models for Free
por: Chen, Runjin, et al.
Publicado: (2025)
por: Chen, Runjin, et al.
Publicado: (2025)
Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models
por: Zhou, Ej, et al.
Publicado: (2025)
por: Zhou, Ej, et al.
Publicado: (2025)
Perspective Transition of Large Language Models for Solving Subjective Tasks
por: Wang, Xiaolong, et al.
Publicado: (2025)
por: Wang, Xiaolong, et al.
Publicado: (2025)
Calibrated Large Language Models for Binary Question Answering
por: Giovannotti, Patrizio, et al.
Publicado: (2024)
por: Giovannotti, Patrizio, et al.
Publicado: (2024)
Self-Calibrated Listwise Reranking with Large Language Models
por: Ren, Ruiyang, et al.
Publicado: (2024)
por: Ren, Ruiyang, et al.
Publicado: (2024)
Thermometer: Towards Universal Calibration for Large Language Models
por: Shen, Maohao, et al.
Publicado: (2024)
por: Shen, Maohao, et al.
Publicado: (2024)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
por: Son, Guijin, et al.
Publicado: (2024)
por: Son, Guijin, et al.
Publicado: (2024)
Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language Models
por: Zhao, Xinran, et al.
Publicado: (2024)
por: Zhao, Xinran, et al.
Publicado: (2024)
Reasoning in Conversation: Solving Subjective Tasks through Dialogue Simulation for Large Language Models
por: Wang, Xiaolong, et al.
Publicado: (2024)
por: Wang, Xiaolong, et al.
Publicado: (2024)
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
por: Li, Ang, et al.
Publicado: (2024)
por: Li, Ang, et al.
Publicado: (2024)
Graph-based Confidence Calibration for Large Language Models
por: Li, Yukun, et al.
Publicado: (2024)
por: Li, Yukun, et al.
Publicado: (2024)
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
por: Liu, Xiaoou, et al.
Publicado: (2025)
por: Liu, Xiaoou, et al.
Publicado: (2025)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
por: Huang, Liangjie, et al.
Publicado: (2025)
por: Huang, Liangjie, et al.
Publicado: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
por: Luo, Weiqing, et al.
Publicado: (2025)
por: Luo, Weiqing, et al.
Publicado: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Calibrating Language Models with Adaptive Temperature Scaling
por: Xie, Johnathan, et al.
Publicado: (2024)
por: Xie, Johnathan, et al.
Publicado: (2024)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
por: Yan, Jianhao, et al.
Publicado: (2024)
por: Yan, Jianhao, et al.
Publicado: (2024)
Confidence Calibration in Large Language Model-Based Entity Matching
por: Kamsteeg, Iris, et al.
Publicado: (2025)
por: Kamsteeg, Iris, et al.
Publicado: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
por: Geng, Jiahui, et al.
Publicado: (2023)
por: Geng, Jiahui, et al.
Publicado: (2023)
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
por: Gao, Jiahui, et al.
Publicado: (2024)
por: Gao, Jiahui, et al.
Publicado: (2024)
Ejemplares similares
-
Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?
por: Khurana, Urja, et al.
Publicado: (2024) -
Calibrating Large Language Models with Sample Consistency
por: Lyu, Qing, et al.
Publicado: (2024) -
Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models
por: Moore, Kyle, et al.
Publicado: (2025) -
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
por: Shao, Wenqi, et al.
Publicado: (2023) -
Calibrating Large Language Models Using Their Generations Only
por: Ulmer, Dennis, et al.
Publicado: (2024)