Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Ej, Zhang, Caiqi, Hu, Tiancheng, Li, Chengzu, Collier, Nigel, Vulić, Ivan, Korhonen, Anna |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
by: Li, Chengzu, et al.
Published: (2024)
by: Li, Chengzu, et al.
Published: (2024)
Quantifying Language Disparities in Multilingual Large Language Models
by: Hu, Songbo, et al.
Published: (2025)
by: Hu, Songbo, et al.
Published: (2025)
Large Language Models are Miscalibrated In-Context Learners
by: Li, Chengzu, et al.
Published: (2023)
by: Li, Chengzu, et al.
Published: (2023)
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
by: Zhang, Caiqi, et al.
Published: (2025)
by: Zhang, Caiqi, et al.
Published: (2025)
Analyzing and Adapting Large Language Models for Few-Shot Multilingual NLU: Are We There Yet?
by: Razumovskaia, Evgeniia, et al.
Published: (2024)
by: Razumovskaia, Evgeniia, et al.
Published: (2024)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
Visual Planning: Let's Think Only with Images
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
Value of Information: A Framework for Human-Agent Communication
by: Dong, Yijiang River, et al.
Published: (2026)
by: Dong, Yijiang River, et al.
Published: (2026)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
by: Liu, Yinhong, et al.
Published: (2024)
by: Liu, Yinhong, et al.
Published: (2024)
DIALIGHT: Lightweight Multilingual Development and Evaluation of Task-Oriented Dialogue Systems with Large Language Models
by: Hu, Songbo, et al.
Published: (2024)
by: Hu, Songbo, et al.
Published: (2024)
Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking
by: Hu, Songbo, et al.
Published: (2026)
by: Hu, Songbo, et al.
Published: (2026)
Lost in Embeddings: Information Loss in Vision-Language Models
by: Li, Wenyan, et al.
Published: (2025)
by: Li, Wenyan, et al.
Published: (2025)
Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation
by: Miranda, Lester James V., et al.
Published: (2026)
by: Miranda, Lester James V., et al.
Published: (2026)
On Bilingual Lexicon Induction with Large Language Models
by: Li, Yaoyiran, et al.
Published: (2023)
by: Li, Yaoyiran, et al.
Published: (2023)
Improving Word Translation via Two-Stage Contrastive Learning
by: Li, Yaoyiran, et al.
Published: (2022)
by: Li, Yaoyiran, et al.
Published: (2022)
Confidence Estimation for LLMs in Multi-turn Interactions
by: Zhang, Caiqi, et al.
Published: (2026)
by: Zhang, Caiqi, et al.
Published: (2026)
All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
by: Zhang, Caiqi, et al.
Published: (2025)
by: Zhang, Caiqi, et al.
Published: (2025)
Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging
by: Hu, Tiancheng, et al.
Published: (2025)
by: Hu, Tiancheng, et al.
Published: (2025)
Conformity in Large Language Models
by: Zhu, Xiaochen, et al.
Published: (2024)
by: Zhu, Xiaochen, et al.
Published: (2024)
iNews: A Multimodal Dataset for Modeling Personalized Affective Responses to News
by: Hu, Tiancheng, et al.
Published: (2025)
by: Hu, Tiancheng, et al.
Published: (2025)
Quantifying the Persona Effect in LLM Simulations
by: Hu, Tiancheng, et al.
Published: (2024)
by: Hu, Tiancheng, et al.
Published: (2024)
Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective
by: Chen, Beiduo, et al.
Published: (2026)
by: Chen, Beiduo, et al.
Published: (2026)
Scaling Sparse Fine-Tuning to Large Language Models
by: Ansell, Alan, et al.
Published: (2024)
by: Ansell, Alan, et al.
Published: (2024)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
by: Liu, Yinhong, et al.
Published: (2024)
by: Liu, Yinhong, et al.
Published: (2024)
LUQ: Long-text Uncertainty Quantification for LLMs
by: Zhang, Caiqi, et al.
Published: (2024)
by: Zhang, Caiqi, et al.
Published: (2024)
Self-Augmented In-Context Learning for Unsupervised Word Translation
by: Li, Yaoyiran, et al.
Published: (2024)
by: Li, Yaoyiran, et al.
Published: (2024)
Atomic Calibration of LLMs in Long-Form Generations
by: Zhang, Caiqi, et al.
Published: (2024)
by: Zhang, Caiqi, et al.
Published: (2024)
Translation-Enhanced Multilingual Text-to-Image Generation
by: Li, Yaoyiran, et al.
Published: (2023)
by: Li, Yaoyiran, et al.
Published: (2023)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
by: Zhou, Han, et al.
Published: (2025)
by: Zhou, Han, et al.
Published: (2025)
AutoPEFT: Automatic Configuration Search for Parameter-Efficient Fine-Tuning
by: Zhou, Han, et al.
Published: (2023)
by: Zhou, Han, et al.
Published: (2023)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
SQATIN: Supervised Instruction Tuning Meets Question Answering for Improved Dialogue NLU
by: Razumovskaia, Evgeniia, et al.
Published: (2023)
by: Razumovskaia, Evgeniia, et al.
Published: (2023)
Can LLM be a Personalized Judge?
by: Dong, Yijiang River, et al.
Published: (2024)
by: Dong, Yijiang River, et al.
Published: (2024)
Bias Beyond English: Evaluating Social Bias and Debiasing Methods in a Low-Resource Setting
by: Zhou, Ej, et al.
Published: (2025)
by: Zhou, Ej, et al.
Published: (2025)
Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding
by: Dong, Yijiang River, et al.
Published: (2026)
by: Dong, Yijiang River, et al.
Published: (2026)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
by: Hu, Tiancheng, et al.
Published: (2025)
by: Hu, Tiancheng, et al.
Published: (2025)
Improving Bilingual Lexicon Induction with Cross-Encoder Reranking
by: Li, Yaoyiran, et al.
Published: (2022)
by: Li, Yaoyiran, et al.
Published: (2022)
Retrofitting Large Language Models with Dynamic Tokenization
by: Feher, Darius, et al.
Published: (2024)
by: Feher, Darius, et al.
Published: (2024)
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
Emergent Communication Pretraining for Few-Shot Machine Translation
by: Li, Yaoyiran, et al.
Published: (2020)
by: Li, Yaoyiran, et al.
Published: (2020)
Similar Items
-
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
by: Li, Chengzu, et al.
Published: (2024) -
Quantifying Language Disparities in Multilingual Large Language Models
by: Hu, Songbo, et al.
Published: (2025) -
Large Language Models are Miscalibrated In-Context Learners
by: Li, Chengzu, et al.
Published: (2023) -
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
by: Zhang, Caiqi, et al.
Published: (2025) -
Analyzing and Adapting Large Language Models for Few-Shot Multilingual NLU: Are We There Yet?
by: Razumovskaia, Evgeniia, et al.
Published: (2024)