Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jha, Abha, Mahajan, Akanksha, Aravindan, Ashwath Vaithinathan, Saravanan, Praveen, Policharla, Sai Sailaja, Gehlot, Sonal Chaturbhuj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Second Guess: Detecting Uncertainty Through Abstention and Answer Stability in Small Language Models
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026)
Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026)
Do VLMs Have Bad Eyes? Diagnosing Compositional Failures via Mechanistic Interpretability
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
Code-Driven Planning in Grid Worlds with Large Language Models
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
Backdoor Defense in Diffusion Models via Spatial Attention Unlearning
por: Jha, Abha, et al.
Publicado: (2025)
por: Jha, Abha, et al.
Publicado: (2025)
Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
The Computational Anatomy of Humility: Modeling Intellectual Humility in Online Public Discourse
por: Guo, Xiaobo, et al.
Publicado: (2024)
por: Guo, Xiaobo, et al.
Publicado: (2024)
Knowledge Graph Analysis of Legal Understanding and Violations in LLMs
por: Jha, Abha, et al.
Publicado: (2025)
por: Jha, Abha, et al.
Publicado: (2025)
Inducing Epistemological Humility in Large Language Models: A Targeted SFT Approach to Reducing Hallucination
por: Uluoglakci, Cem, et al.
Publicado: (2026)
por: Uluoglakci, Cem, et al.
Publicado: (2026)
Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets
por: Gowtham, et al.
Publicado: (2025)
por: Gowtham, et al.
Publicado: (2025)
Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models
por: Madhusudhan, Nishanth, et al.
Publicado: (2024)
por: Madhusudhan, Nishanth, et al.
Publicado: (2024)
Answer When Needed, Forget When Not: Language Models Pretend to Forget via In-Context Knowledge Unlearning
por: Takashiro, Shota, et al.
Publicado: (2024)
por: Takashiro, Shota, et al.
Publicado: (2024)
Tourism Question Answer System in Indian Language using Domain-Adapted Foundation Models
por: Gatla, Praveen, et al.
Publicado: (2025)
por: Gatla, Praveen, et al.
Publicado: (2025)
Deploying Large Language Models With Retrieval Augmented Generation
por: Prabhune, Sonal, et al.
Publicado: (2024)
por: Prabhune, Sonal, et al.
Publicado: (2024)
A Review on Large Language Models for Visual Analytics
por: Agarwal, Navya Sonal, et al.
Publicado: (2025)
por: Agarwal, Navya Sonal, et al.
Publicado: (2025)
Refining Answer Distributions for Improved Large Language Model Reasoning
por: Pal, Soumyasundar, et al.
Publicado: (2024)
por: Pal, Soumyasundar, et al.
Publicado: (2024)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
por: He, Jiahang, et al.
Publicado: (2025)
por: He, Jiahang, et al.
Publicado: (2025)
Measuring the Quality of Answers in Political Q&As with Large Language Models
por: Alvarez, R. Michael, et al.
Publicado: (2024)
por: Alvarez, R. Michael, et al.
Publicado: (2024)
Evaluating Nuanced Bias in Large Language Model Free Response Answers
por: Healey, Jennifer, et al.
Publicado: (2024)
por: Healey, Jennifer, et al.
Publicado: (2024)
Cancer-Answer: Empowering Cancer Care with Advanced Large Language Models
por: Deroy, Aniket, et al.
Publicado: (2024)
por: Deroy, Aniket, et al.
Publicado: (2024)
Sparse Reward Subsystem in Large Language Models
por: Xu, Guowei, et al.
Publicado: (2026)
por: Xu, Guowei, et al.
Publicado: (2026)
Using Pretrained Large Language Model with Prompt Engineering to Answer Biomedical Questions
por: Zhou, Wenxin, et al.
Publicado: (2024)
por: Zhou, Wenxin, et al.
Publicado: (2024)
IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property
por: Wang, Qiyao, et al.
Publicado: (2025)
por: Wang, Qiyao, et al.
Publicado: (2025)
The Rosetta Paradox: Domain-Specific Performance Inversions in Large Language Models
por: Jha, Basab, et al.
Publicado: (2024)
por: Jha, Basab, et al.
Publicado: (2024)
Generalist Reward Models: Found Inside Large Language Models
por: Li, Yi-Chen, et al.
Publicado: (2025)
por: Li, Yi-Chen, et al.
Publicado: (2025)
Enhancing Answer Reliability Through Inter-Model Consensus of Large Language Models
por: Amiri-Margavi, Alireza, et al.
Publicado: (2024)
por: Amiri-Margavi, Alireza, et al.
Publicado: (2024)
Evaluation Methodology for Large Language Models for Multilingual Document Question and Answer
por: Kahana, Adar, et al.
Publicado: (2024)
por: Kahana, Adar, et al.
Publicado: (2024)
Enhancing Answer Attribution for Faithful Text Generation with Large Language Models
por: Vladika, Juraj, et al.
Publicado: (2024)
por: Vladika, Juraj, et al.
Publicado: (2024)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2024)
por: Zhang, Zhihan, et al.
Publicado: (2024)
Synthetic Query Generation using Large Language Models for Virtual Assistants
por: Sannigrahi, Sonal, et al.
Publicado: (2024)
por: Sannigrahi, Sonal, et al.
Publicado: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
por: Hu, Bokai, et al.
Publicado: (2024)
por: Hu, Bokai, et al.
Publicado: (2024)
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
por: Yin, Zhangyue, et al.
Publicado: (2024)
por: Yin, Zhangyue, et al.
Publicado: (2024)
Question: How do Large Language Models perform on the Question Answering tasks? Answer:
por: Fischer, Kevin, et al.
Publicado: (2024)
por: Fischer, Kevin, et al.
Publicado: (2024)
Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework
por: Xu, Zishan, et al.
Publicado: (2025)
por: Xu, Zishan, et al.
Publicado: (2025)
Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning
por: Kansal, Yuval, et al.
Publicado: (2026)
por: Kansal, Yuval, et al.
Publicado: (2026)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
por: Hong, Haitao, et al.
Publicado: (2025)
por: Hong, Haitao, et al.
Publicado: (2025)
Upcycling Large Language Models into Mixture of Experts
por: He, Ethan, et al.
Publicado: (2024)
por: He, Ethan, et al.
Publicado: (2024)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
por: Wang, Chengbing, et al.
Publicado: (2026)
por: Wang, Chengbing, et al.
Publicado: (2026)
Ejemplares similares
-
Second Guess: Detecting Uncertainty Through Abstention and Answer Stability in Small Language Models
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026) -
Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2026) -
Do VLMs Have Bad Eyes? Diagnosing Compositional Failures via Mechanistic Interpretability
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025) -
Code-Driven Planning in Grid Worlds with Large Language Models
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025) -
Backdoor Defense in Diffusion Models via Spatial Attention Unlearning
por: Jha, Abha, et al.
Publicado: (2025)