Mapping from Meaning: Addressing the Miscalibration of Prompt-Sensitive Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cox, Kyle, Xu, Jiawei, Han, Yikun, Xu, Rong, Li, Tianhao, Hsu, Chi-Yang, Chen, Tianlong, Gerych, Walter, Ding, Ying |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Thought Graph: Generating Thought Process for Biological Reasoning
by: Hsu, Chi-Yang, et al.
Published: (2024)
by: Hsu, Chi-Yang, et al.
Published: (2024)
TAXI: Evaluating Categorical Knowledge Editing for Language Models
by: Powell, Derek, et al.
Published: (2024)
by: Powell, Derek, et al.
Published: (2024)
Large Language Models are Miscalibrated In-Context Learners
by: Li, Chengzu, et al.
Published: (2023)
by: Li, Chengzu, et al.
Published: (2023)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
Identifying Implicit Social Biases in Vision-Language Models
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
Extreme Miscalibration and the Illusion of Adversarial Robustness
by: Raina, Vyas, et al.
Published: (2024)
by: Raina, Vyas, et al.
Published: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
by: Xu, Xin, et al.
Published: (2026)
by: Xu, Xin, et al.
Published: (2026)
Hallucination, Monofacts, and Miscalibration: An Empirical Investigation
by: Miao, Miranda Muqing, et al.
Published: (2025)
by: Miao, Miranda Muqing, et al.
Published: (2025)
Unveiling and Addressing Pseudo Forgetting in Large Language Models
by: Sun, Huashan, et al.
Published: (2024)
by: Sun, Huashan, et al.
Published: (2024)
On Language Models' Sensitivity to Suspicious Coincidences
by: Padmanabhan, Sriram, et al.
Published: (2025)
by: Padmanabhan, Sriram, et al.
Published: (2025)
Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models
by: Xiang, Yanzheng, et al.
Published: (2024)
by: Xiang, Yanzheng, et al.
Published: (2024)
Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models
by: Bakhshi, Asim D.
Published: (2026)
by: Bakhshi, Asim D.
Published: (2026)
The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
by: Xuan, Weihao, et al.
Published: (2026)
by: Xuan, Weihao, et al.
Published: (2026)
Knowledge Tagging with Large Language Model based Multi-Agent System
by: Li, Hang, et al.
Published: (2024)
by: Li, Hang, et al.
Published: (2024)
Understanding the Prompt Sensitivity
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
by: Xiao, Yuxin, et al.
Published: (2025)
by: Xiao, Yuxin, et al.
Published: (2025)
Incongruent Positivity: When Miscalibrated Positivity Undermines Online Supportive Conversations
by: Almajed, Leen, et al.
Published: (2025)
by: Almajed, Leen, et al.
Published: (2025)
Progressive Residual Warmup for Language Model Pretraining
by: Chen, Tianhao, et al.
Published: (2026)
by: Chen, Tianhao, et al.
Published: (2026)
Benchmarking Prompt Sensitivity in Large Language Models
by: Razavi, Amirhossein, et al.
Published: (2025)
by: Razavi, Amirhossein, et al.
Published: (2025)
Prompt Orchestration Markup Language
by: Zhang, Yuge, et al.
Published: (2025)
by: Zhang, Yuge, et al.
Published: (2025)
LIMP: Large Language Model Enhanced Intent-aware Mobility Prediction
by: Li, Songwei, et al.
Published: (2024)
by: Li, Songwei, et al.
Published: (2024)
Uncertainty Aware Learning for Language Model Alignment
by: Wang, Yikun, et al.
Published: (2024)
by: Wang, Yikun, et al.
Published: (2024)
DecoPrompt : Decoding Prompts Reduces Hallucinations when Large Language Models Meet False Premises
by: Xu, Nan, et al.
Published: (2024)
by: Xu, Nan, et al.
Published: (2024)
Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction
by: Fang, Jinrui, et al.
Published: (2026)
by: Fang, Jinrui, et al.
Published: (2026)
Understanding and Mitigating Miscalibration in Prompt Tuning for Vision-Language Models
by: Wang, Shuoyuan, et al.
Published: (2024)
by: Wang, Shuoyuan, et al.
Published: (2024)
Large Language Models on Graphs: A Comprehensive Survey
by: Jin, Bowen, et al.
Published: (2023)
by: Jin, Bowen, et al.
Published: (2023)
On Overcoming Miscalibrated Conversational Priors in LLM-based Chatbots
by: Herlihy, Christine, et al.
Published: (2024)
by: Herlihy, Christine, et al.
Published: (2024)
METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth
by: Li, Jiawei, et al.
Published: (2024)
by: Li, Jiawei, et al.
Published: (2024)
$\textit{LinkPrompt}$: Natural and Universal Adversarial Attacks on Prompt-based Language Models
by: Xu, Yue, et al.
Published: (2024)
by: Xu, Yue, et al.
Published: (2024)
Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning
by: Wang, Kaipeng, et al.
Published: (2024)
by: Wang, Kaipeng, et al.
Published: (2024)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
by: Qian, Tianhao
Published: (2026)
by: Qian, Tianhao
Published: (2026)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
by: Xu, Zukang, et al.
Published: (2025)
by: Xu, Zukang, et al.
Published: (2025)
Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting
by: Mühlenbernd, Roland
Published: (2026)
by: Mühlenbernd, Roland
Published: (2026)
Pre-trained Language Models Improve the Few-shot Prompt Ability of Decision Transformer
by: Yang, Yu, et al.
Published: (2024)
by: Yang, Yu, et al.
Published: (2024)
Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions
by: Wang, Ziyue, et al.
Published: (2023)
by: Wang, Ziyue, et al.
Published: (2023)
R.I.P.: Better Models by Survival of the Fittest Prompts
by: Yu, Ping, et al.
Published: (2025)
by: Yu, Ping, et al.
Published: (2025)
A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
by: Chang, Trenton, et al.
Published: (2025)
by: Chang, Trenton, et al.
Published: (2025)
Revisiting Prompt Sensitivity in Large Language Models for Text Classification: The Role of Prompt Underspecification
by: Pecher, Branislav, et al.
Published: (2026)
by: Pecher, Branislav, et al.
Published: (2026)
POSIX: A Prompt Sensitivity Index For Large Language Models
by: Chatterjee, Anwoy, et al.
Published: (2024)
by: Chatterjee, Anwoy, et al.
Published: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Similar Items
-
Thought Graph: Generating Thought Process for Biological Reasoning
by: Hsu, Chi-Yang, et al.
Published: (2024) -
TAXI: Evaluating Categorical Knowledge Editing for Language Models
by: Powell, Derek, et al.
Published: (2024) -
Large Language Models are Miscalibrated In-Context Learners
by: Li, Chengzu, et al.
Published: (2023) -
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025) -
Identifying Implicit Social Biases in Vision-Language Models
by: Hamidieh, Kimia, et al.
Published: (2024)