Toward Honest Language Models for Deductive Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Jiarui, Dhole, Kaustubh, Wang, Yingheng, Wen, Haoyang, Zhang, Sarah, Mao, Haitao, Li, Gaotang, Varshney, Neeraj, Liu, Jingguo, Pan, Xiaoman |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models
by: Dhole, Kaustubh D.
Published: (2026)
by: Dhole, Kaustubh D.
Published: (2026)
PyTerrier-GenRank: The PyTerrier Plugin for Reranking with Large Language Models
by: Dhole, Kaustubh D.
Published: (2024)
by: Dhole, Kaustubh D.
Published: (2024)
KAUCUS: Knowledge Augmented User Simulators for Training Language Model Assistants
by: Dhole, Kaustubh D.
Published: (2024)
by: Dhole, Kaustubh D.
Published: (2024)
A Multi-Encoder Frozen-Decoder Approach for Fine-Tuning Large Language Models
by: Dhole, Kaustubh D.
Published: (2025)
by: Dhole, Kaustubh D.
Published: (2025)
Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation
by: Dhole, Kaustubh
Published: (2025)
by: Dhole, Kaustubh
Published: (2025)
Resolving Intent Ambiguities by Retrieving Discriminative Clarifying Questions
by: Dhole, Kaustubh D.
Published: (2020)
by: Dhole, Kaustubh D.
Published: (2020)
GenQREnsemble: Zero-Shot LLM Ensemble Prompting for Generative Query Reformulation
by: Dhole, Kaustubh, et al.
Published: (2024)
by: Dhole, Kaustubh, et al.
Published: (2024)
To Retrieve or Not to Retrieve? Uncertainty Detection for Dynamic Retrieval Augmented Generation
by: Dhole, Kaustubh D.
Published: (2025)
by: Dhole, Kaustubh D.
Published: (2025)
HonestLLM: Toward an Honest and Helpful Large Language Model
by: Gao, Chujie, et al.
Published: (2024)
by: Gao, Chujie, et al.
Published: (2024)
RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation
by: Dhole, Kaustubh D., et al.
Published: (2026)
by: Dhole, Kaustubh D., et al.
Published: (2026)
Toward Mechanistic Explanation of Deductive Reasoning in Language Models
by: Maltoni, Davide, et al.
Published: (2025)
by: Maltoni, Davide, et al.
Published: (2025)
The Role of Deductive and Inductive Reasoning in Large Language Models
by: Cai, Chengkun, et al.
Published: (2024)
by: Cai, Chengkun, et al.
Published: (2024)
DUQGen: Effective Unsupervised Domain Adaptation of Neural Rankers by Diversifying Synthetic Query Generation
by: Chandradevan, Ramraj, et al.
Published: (2024)
by: Chandradevan, Ramraj, et al.
Published: (2024)
Taming Knowledge Conflicts in Language Models
by: Li, Gaotang, et al.
Published: (2025)
by: Li, Gaotang, et al.
Published: (2025)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
by: Patel, Nisarg, et al.
Published: (2024)
by: Patel, Nisarg, et al.
Published: (2024)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
by: Parmar, Mihir, et al.
Published: (2024)
by: Parmar, Mihir, et al.
Published: (2024)
Abstraction-of-Thought Makes Language Models Better Reasoners
by: Hong, Ruixin, et al.
Published: (2024)
by: Hong, Ruixin, et al.
Published: (2024)
ConQRet: Benchmarking Fine-Grained Evaluation of Retrieval Augmented Argumentation with LLM Judges
by: Dhole, Kaustubh D., et al.
Published: (2024)
by: Dhole, Kaustubh D., et al.
Published: (2024)
Generative Query Reformulation Using Ensemble Prompting, Document Fusion, and Relevance Feedback
by: Dhole, Kaustubh D., et al.
Published: (2024)
by: Dhole, Kaustubh D., et al.
Published: (2024)
Evaluating Hybrid Retrieval Augmented Generation using Dynamic Test Sets: LiveRAG Challenge
by: Fensore, Chase, et al.
Published: (2025)
by: Fensore, Chase, et al.
Published: (2025)
Towards LogiGLUE: A Brief Survey and A Benchmark for Analyzing Logical Reasoning Capabilities of Language Models
by: Luo, Man, et al.
Published: (2023)
by: Luo, Man, et al.
Published: (2023)
Investigating the Robustness of Deductive Reasoning with Large Language Models
by: Hoppe, Fabian, et al.
Published: (2025)
by: Hoppe, Fabian, et al.
Published: (2025)
InsertRank: LLMs can reason over BM25 scores to Improve Listwise Reranking
by: Seetharaman, Rahul, et al.
Published: (2025)
by: Seetharaman, Rahul, et al.
Published: (2025)
BeHonest: Benchmarking Honesty in Large Language Models
by: Chern, Steffi, et al.
Published: (2024)
by: Chern, Steffi, et al.
Published: (2024)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
by: Li, Yitian, et al.
Published: (2024)
by: Li, Yitian, et al.
Published: (2024)
Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness
by: Jayarao, Pratik, et al.
Published: (2025)
by: Jayarao, Pratik, et al.
Published: (2025)
AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game
by: Chi, Yizhou, et al.
Published: (2024)
by: Chi, Yizhou, et al.
Published: (2024)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
by: Mondorf, Philipp, et al.
Published: (2024)
by: Mondorf, Philipp, et al.
Published: (2024)
Are Large Language Models More Honest in Their Probabilistic or Verbalized Confidence?
by: Ni, Shiyu, et al.
Published: (2024)
by: Ni, Shiyu, et al.
Published: (2024)
Chaos with Keywords: Exposing Large Language Models Sycophantic Hallucination to Misleading Keywords and Evaluating Defense Strategies
by: RRV, Aswin, et al.
Published: (2024)
by: RRV, Aswin, et al.
Published: (2024)
CodeS: Towards Building Open-source Language Models for Text-to-SQL
by: Li, Haoyang, et al.
Published: (2024)
by: Li, Haoyang, et al.
Published: (2024)
Evaluating the Deductive Competence of Large Language Models
by: Seals, Spencer M., et al.
Published: (2023)
by: Seals, Spencer M., et al.
Published: (2023)
TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games
by: Yuan, Yuan, et al.
Published: (2025)
by: Yuan, Yuan, et al.
Published: (2025)
Bias Amplification Enhances Minority Group Performance
by: Li, Gaotang, et al.
Published: (2023)
by: Li, Gaotang, et al.
Published: (2023)
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
by: Chen, Bocheng, et al.
Published: (2026)
by: Chen, Bocheng, et al.
Published: (2026)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
by: Chen, Xinxi, et al.
Published: (2024)
by: Chen, Xinxi, et al.
Published: (2024)
Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning
by: Mordig, Maximilian, et al.
Published: (2026)
by: Mordig, Maximilian, et al.
Published: (2026)
CausalEval: Towards Better Causal Reasoning in Language Models
by: Yu, Longxuan, et al.
Published: (2024)
by: Yu, Longxuan, et al.
Published: (2024)
FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness
by: Dong, Xiaoning, et al.
Published: (2026)
by: Dong, Xiaoning, et al.
Published: (2026)
Similar Items
-
BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models
by: Dhole, Kaustubh D.
Published: (2026) -
PyTerrier-GenRank: The PyTerrier Plugin for Reranking with Large Language Models
by: Dhole, Kaustubh D.
Published: (2024) -
KAUCUS: Knowledge Augmented User Simulators for Training Language Model Assistants
by: Dhole, Kaustubh D.
Published: (2024) -
A Multi-Encoder Frozen-Decoder Approach for Fine-Tuning Large Language Models
by: Dhole, Kaustubh D.
Published: (2025) -
Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation
by: Dhole, Kaustubh
Published: (2025)