Calibration Across Layers: Understanding Calibration Evolution in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Joshi, Abhinav, Ahmad, Areeb, Modi, Ashutosh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits
par: Ahmad, Areeb, et autres
Publié: (2025)
par: Ahmad, Areeb, et autres
Publié: (2025)
COLD: Causal reasOning in cLosed Daily activities
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
Towards Quantifying Commonsense Reasoning with Mechanistic Insights
par: Joshi, Abhinav, et autres
Publié: (2025)
par: Joshi, Abhinav, et autres
Publié: (2025)
Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models
par: Shukla, Divyaksh, et autres
Publié: (2026)
par: Shukla, Divyaksh, et autres
Publié: (2026)
Geometry of Decision Making in Language Models
par: Joshi, Abhinav, et autres
Publié: (2025)
par: Joshi, Abhinav, et autres
Publié: (2025)
IL-TUR: Benchmark for Indian Legal Text Understanding and Reasoning
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
POSESTITCH-SLT: Linguistically Inspired Pose-Stitching for End-to-End Sign Language Translation
par: Joshi, Abhinav, et autres
Publié: (2025)
par: Joshi, Abhinav, et autres
Publié: (2025)
Towards Robust Evaluation of Unlearning in LLMs via Data Transformations
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
IITK at SemEval-2024 Task 2: Exploring the Capabilities of LLMs for Safe Biomedical Natural Language Inference for Clinical Trials
par: Mandal, Shreyasi, et autres
Publié: (2024)
par: Mandal, Shreyasi, et autres
Publié: (2024)
LoRMA: Low-Rank Multiplicative Adaptation for LLMs
par: Bihany, Harsh, et autres
Publié: (2025)
par: Bihany, Harsh, et autres
Publié: (2025)
SLaNC: Static LayerNorm Calibration
par: Salmani, Mahsa, et autres
Publié: (2024)
par: Salmani, Mahsa, et autres
Publié: (2024)
IITK at SemEval-2024 Task 4: Hierarchical Embeddings for Detection of Persuasion Techniques in Memes
par: Chikoti, Shreenaga, et autres
Publié: (2024)
par: Chikoti, Shreenaga, et autres
Publié: (2024)
IITK at SemEval-2024 Task 10: Who is the speaker? Improving Emotion Recognition and Flip Reasoning in Conversations via Speaker Embeddings
par: Patel, Shubham, et autres
Publié: (2024)
par: Patel, Shubham, et autres
Publié: (2024)
iSign: A Benchmark for Indian Sign Language Processing
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
Jailbreaking LLMs via Calibration
par: Lu, Yuxuan, et autres
Publié: (2026)
par: Lu, Yuxuan, et autres
Publié: (2026)
Generation and De-Identification of Indian Clinical Discharge Summaries using LLMs
par: Singh, Sanjeet, et autres
Publié: (2024)
par: Singh, Sanjeet, et autres
Publié: (2024)
IITK at SemEval-2024 Task 1: Contrastive Learning and Autoencoders for Semantic Textual Relatedness in Multilingual Texts
par: Basak, Udvas, et autres
Publié: (2024)
par: Basak, Udvas, et autres
Publié: (2024)
EtiCor++: Towards Understanding Etiquettical Bias in LLMs
par: Dwivedi, Ashutosh, et autres
Publié: (2025)
par: Dwivedi, Ashutosh, et autres
Publié: (2025)
Batch Calibration: Rethinking Calibration for In-Context Learning and Prompt Engineering
par: Zhou, Han, et autres
Publié: (2023)
par: Zhou, Han, et autres
Publié: (2023)
Calibrating LLMs for Text-to-SQL Parsing by Leveraging Sub-clause Frequencies
par: Liu, Terrance, et autres
Publié: (2025)
par: Liu, Terrance, et autres
Publié: (2025)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
par: Wen, Zhuofan, et autres
Publié: (2026)
par: Wen, Zhuofan, et autres
Publié: (2026)
Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
par: Dai, Hui, et autres
Publié: (2026)
par: Dai, Hui, et autres
Publié: (2026)
Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning
par: Kim, Minkyu, et autres
Publié: (2026)
par: Kim, Minkyu, et autres
Publié: (2026)
On the Entropy Calibration of Language Models
par: Cao, Steven, et autres
Publié: (2025)
par: Cao, Steven, et autres
Publié: (2025)
BookSQL: A Large Scale Text-to-SQL Dataset for Accounting Domain
par: Kumar, Rahul, et autres
Publié: (2024)
par: Kumar, Rahul, et autres
Publié: (2024)
A Study on the Calibration of In-context Learning
par: Zhang, Hanlin, et autres
Publié: (2023)
par: Zhang, Hanlin, et autres
Publié: (2023)
Linguistic Calibration of Long-Form Generations
par: Band, Neil, et autres
Publié: (2024)
par: Band, Neil, et autres
Publié: (2024)
Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs
par: Sahoo, Subramanyam
Publié: (2026)
par: Sahoo, Subramanyam
Publié: (2026)
CoMuMDR: Code-mixed Multi-modal Multi-domain corpus for Discourse paRsing in conversations
par: Shukla, Divyaksh, et autres
Publié: (2025)
par: Shukla, Divyaksh, et autres
Publié: (2025)
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs
par: Oliveira, Rafael C. T.
Publié: (2026)
par: Oliveira, Rafael C. T.
Publié: (2026)
Revisiting Uncertainty Estimation and Calibration of Large Language Models
par: Tao, Linwei, et autres
Publié: (2025)
par: Tao, Linwei, et autres
Publié: (2025)
Efficient Test-Time Scaling via Self-Calibration
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
Beware of Calibration Data for Pruning Large Language Models
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
On Calibration of Large Language Models: From Response To Capability
par: Yang, Sin-Han, et autres
Publié: (2026)
par: Yang, Sin-Han, et autres
Publié: (2026)
Fill In The Gaps: Model Calibration and Generalization with Synthetic Data
par: Ba, Yang, et autres
Publié: (2024)
par: Ba, Yang, et autres
Publié: (2024)
Calibrating Large Language Models Using Their Generations Only
par: Ulmer, Dennis, et autres
Publié: (2024)
par: Ulmer, Dennis, et autres
Publié: (2024)
Calibrated Surprise: An Information-Theoretic Account of Creative Quality
par: Zou, Bo, et autres
Publié: (2026)
par: Zou, Bo, et autres
Publié: (2026)
Enhancing In-context Learning via Linear Probe Calibration
par: Abbas, Momin, et autres
Publié: (2024)
par: Abbas, Momin, et autres
Publié: (2024)
Documents similaires
-
Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits
par: Ahmad, Areeb, et autres
Publié: (2025) -
COLD: Causal reasOning in cLosed Daily activities
par: Joshi, Abhinav, et autres
Publié: (2024) -
Towards Quantifying Commonsense Reasoning with Mechanistic Insights
par: Joshi, Abhinav, et autres
Publié: (2025) -
Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models
par: Shukla, Divyaksh, et autres
Publié: (2026) -
Geometry of Decision Making in Language Models
par: Joshi, Abhinav, et autres
Publié: (2025)