Characterizing LLM Abstention Behavior in Science QA with Context Perturbations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wen, Bingbing, Howe, Bill, Wang, Lucy Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Know Your Limits: A Survey of Abstention in Large Language Models
par: Wen, Bingbing, et autres
Publié: (2024)
par: Wen, Bingbing, et autres
Publié: (2024)
STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes
par: Xu, Chenjun, et autres
Publié: (2026)
par: Xu, Chenjun, et autres
Publié: (2026)
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
par: Wen, Bingbing, et autres
Publié: (2026)
par: Wen, Bingbing, et autres
Publié: (2026)
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
par: Cao, Zongwan, et autres
Publié: (2026)
par: Cao, Zongwan, et autres
Publié: (2026)
ML-EAT: A Multilevel Embedding Association Test for Interpretable and Transparent Social Science
par: Wolfe, Robert, et autres
Publié: (2024)
par: Wolfe, Robert, et autres
Publié: (2024)
Epistemic Alignment: A Mediating Framework for User-LLM Knowledge Delivery
par: Clark, Nicholas, et autres
Publié: (2025)
par: Clark, Nicholas, et autres
Publié: (2025)
Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning
par: Srinivasan, Tejas, et autres
Publié: (2024)
par: Srinivasan, Tejas, et autres
Publié: (2024)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions
par: Atif, Farah, et autres
Publié: (2025)
par: Atif, Farah, et autres
Publié: (2025)
I-CALM: Incentivizing Confidence-Aware Abstention for LLM Hallucination Mitigation
par: Zong, Haotian, et autres
Publié: (2026)
par: Zong, Haotian, et autres
Publié: (2026)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
par: Han, Bin, et autres
Publié: (2024)
par: Han, Bin, et autres
Publié: (2024)
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
par: Bologna, Federica, et autres
Publié: (2025)
par: Bologna, Federica, et autres
Publié: (2025)
What External Knowledge is Preferred by LLMs? Characterizing and Exploring Chain of Evidence in Imperfect Context for Multi-Hop QA
par: Chang, Zhiyuan, et autres
Publié: (2024)
par: Chang, Zhiyuan, et autres
Publié: (2024)
Can Large Language Models Integrate Spatial Data? Empirical Insights into Reasoning Strengths and Computational Weaknesses
par: Han, Bin, et autres
Publié: (2025)
par: Han, Bin, et autres
Publié: (2025)
NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts
par: Gupta, Abhay, et autres
Publié: (2025)
par: Gupta, Abhay, et autres
Publié: (2025)
When to Speak, When to Abstain: Contrastive Decoding with Abstention
par: Kim, Hyuhng Joon, et autres
Publié: (2024)
par: Kim, Hyuhng Joon, et autres
Publié: (2024)
MASH: Modeling Abstention via Selective Help-Seeking
par: Gul, Mustafa Omer, et autres
Publié: (2025)
par: Gul, Mustafa Omer, et autres
Publié: (2025)
DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels
par: Xu, Zhe, et autres
Publié: (2024)
par: Xu, Zhe, et autres
Publié: (2024)
Expect the Unexpected: FailSafe Long Context QA for Finance
par: Kamble, Kiran, et autres
Publié: (2025)
par: Kamble, Kiran, et autres
Publié: (2025)
KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation
par: Tatarinov, Nikita, et autres
Publié: (2025)
par: Tatarinov, Nikita, et autres
Publié: (2025)
Representation Bias of Adolescents in AI: A Bilingual, Bicultural Study
par: Wolfe, Robert, et autres
Publié: (2024)
par: Wolfe, Robert, et autres
Publié: (2024)
Knowledge Graph Guided Evaluation of Abstention Techniques
par: Vasisht, Kinshuk, et autres
Publié: (2024)
par: Vasisht, Kinshuk, et autres
Publié: (2024)
Geometry-Calibrated Conformal Abstention for Language Models
par: Xu, Rui, et autres
Publié: (2026)
par: Xu, Rui, et autres
Publié: (2026)
Effective Skill Unlearning through Intervention and Abstention
par: Li, Yongce, et autres
Publié: (2025)
par: Li, Yongce, et autres
Publié: (2025)
Dataset Scale and Societal Consistency Mediate Facial Impression Bias in Vision-Language AI
par: Wolfe, Robert, et autres
Publié: (2024)
par: Wolfe, Robert, et autres
Publié: (2024)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
par: Dineen, Jacob, et autres
Publié: (2025)
par: Dineen, Jacob, et autres
Publié: (2025)
InfoLossQA: Characterizing and Recovering Information Loss in Text Simplification
par: Trienes, Jan, et autres
Publié: (2024)
par: Trienes, Jan, et autres
Publié: (2024)
According to Me: Long-Term Personalized Referential Memory QA
par: Mei, Jingbiao, et autres
Publié: (2026)
par: Mei, Jingbiao, et autres
Publié: (2026)
KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning
par: Dang, Xilin, et autres
Publié: (2025)
par: Dang, Xilin, et autres
Publié: (2025)
GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence
par: Zhao, Yibo, et autres
Publié: (2026)
par: Zhao, Yibo, et autres
Publié: (2026)
Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA
par: Maheshwary, Rishabh, et autres
Publié: (2025)
par: Maheshwary, Rishabh, et autres
Publié: (2025)
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
par: Chen, Jiaju, et autres
Publié: (2023)
par: Chen, Jiaju, et autres
Publié: (2023)
Knowing When Not to Answer: Abstention-Aware Scientific Reasoning
par: Abdaljalil, Samir, et autres
Publié: (2026)
par: Abdaljalil, Samir, et autres
Publié: (2026)
MKA: Leveraging Cross-Lingual Consensus for Model Abstention
par: Duwal, Sharad
Publié: (2025)
par: Duwal, Sharad
Publié: (2025)
RepoQA: Evaluating Long Context Code Understanding
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations
par: Hong, Pingjun, et autres
Publié: (2026)
par: Hong, Pingjun, et autres
Publié: (2026)
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
par: Pan, Muyu, et autres
Publié: (2026)
par: Pan, Muyu, et autres
Publié: (2026)
Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation
par: Li, Zichong, et autres
Publié: (2026)
par: Li, Zichong, et autres
Publié: (2026)
Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems
par: Madhusudhan, Nishanth, et autres
Publié: (2026)
par: Madhusudhan, Nishanth, et autres
Publié: (2026)
PaperHelper: Knowledge-Based LLM QA Paper Reading Assistant
par: Yin, Congrui, et autres
Publié: (2025)
par: Yin, Congrui, et autres
Publié: (2025)
Documents similaires
-
Know Your Limits: A Survey of Abstention in Large Language Models
par: Wen, Bingbing, et autres
Publié: (2024) -
STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes
par: Xu, Chenjun, et autres
Publié: (2026) -
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
par: Wen, Bingbing, et autres
Publié: (2026) -
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
par: Cao, Zongwan, et autres
Publié: (2026) -
ML-EAT: A Multilevel Embedding Association Test for Interpretable and Transparent Social Science
par: Wolfe, Robert, et autres
Publié: (2024)