Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
Fuente:
arXiv
Guardado en:
| Autores principales: | McMillan, Teague, Dominici, Gabriele, Gjoreski, Martin, Langheinrich, Marc |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Federated Behavioural Planes: Explaining the Evolution of Client Behaviour in Federated Learning
por: Fenoglio, Dario, et al.
Publicado: (2024)
por: Fenoglio, Dario, et al.
Publicado: (2024)
Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation
por: Sovrano, Francesco, et al.
Publicado: (2026)
por: Sovrano, Francesco, et al.
Publicado: (2026)
Counterfactual Concept Bottleneck Models
por: Dominici, Gabriele, et al.
Publicado: (2024)
por: Dominici, Gabriele, et al.
Publicado: (2024)
Evaluating Explanations Through LLMs: Beyond Traditional User Studies
por: De Bona, Francesco Bombassei, et al.
Publicado: (2024)
por: De Bona, Francesco Bombassei, et al.
Publicado: (2024)
Instruction Adherence in Coding Agent Configuration Files: A Factorial Study of Four File-Structure Variables
por: McMillan, Damon
Publicado: (2026)
por: McMillan, Damon
Publicado: (2026)
Structured Context Engineering for File-Native Agentic Systems: Evaluating Schema Accuracy, Format Effectiveness, and Multi-File Navigation at Scale
por: McMillan, Damon
Publicado: (2026)
por: McMillan, Damon
Publicado: (2026)
Causal Concept Graph Models: Beyond Causal Opacity in Deep Learning
por: Dominici, Gabriele, et al.
Publicado: (2024)
por: Dominici, Gabriele, et al.
Publicado: (2024)
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
por: Krsteski, Stefan, et al.
Publicado: (2025)
por: Krsteski, Stefan, et al.
Publicado: (2025)
Counterfactual Explanations for Clustering Models
por: Spagnol, Aurora, et al.
Publicado: (2024)
por: Spagnol, Aurora, et al.
Publicado: (2024)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
por: Luo, Linhao, et al.
Publicado: (2023)
por: Luo, Linhao, et al.
Publicado: (2023)
On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models
por: Tanneru, Sree Harsha, et al.
Publicado: (2024)
por: Tanneru, Sree Harsha, et al.
Publicado: (2024)
FaithLM: Towards Faithful Explanations for Large Language Models
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
Graph-constrained Reasoning: Faithful Reasoning on Knowledge Graphs with Large Language Models
por: Luo, Linhao, et al.
Publicado: (2024)
por: Luo, Linhao, et al.
Publicado: (2024)
Mapping Faithful Reasoning in Language Models
por: Li, Jiazheng, et al.
Publicado: (2025)
por: Li, Jiazheng, et al.
Publicado: (2025)
Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models
por: Yeo, Wei Jie, et al.
Publicado: (2024)
por: Yeo, Wei Jie, et al.
Publicado: (2024)
AnyCBMs: How to Turn Any Black Box into a Concept Bottleneck Model
por: Dominici, Gabriele, et al.
Publicado: (2024)
por: Dominici, Gabriele, et al.
Publicado: (2024)
FaithUn: Toward Faithful Forgetting in Language Models by Investigating the Interconnectedness of Knowledge
por: Yang, Nakyeong, et al.
Publicado: (2025)
por: Yang, Nakyeong, et al.
Publicado: (2025)
Policy Frameworks for Transparent Chain-of-Thought Reasoning in Large Language Models
por: Chen, Yihang, et al.
Publicado: (2025)
por: Chen, Yihang, et al.
Publicado: (2025)
Mitigating Large Language Model Hallucination with Faithful Finetuning
por: Hu, Minda, et al.
Publicado: (2024)
por: Hu, Minda, et al.
Publicado: (2024)
Federated Learning with Profile Mapping under Distribution Shifts and Drifts
por: Li, Mohan, et al.
Publicado: (2026)
por: Li, Mohan, et al.
Publicado: (2026)
Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation
por: Khan, Eeham, et al.
Publicado: (2026)
por: Khan, Eeham, et al.
Publicado: (2026)
RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models
por: Han, Yunseok, et al.
Publicado: (2026)
por: Han, Yunseok, et al.
Publicado: (2026)
Towards Transparent AI: A Survey on Explainable Large Language Models
por: Palikhe, Avash, et al.
Publicado: (2025)
por: Palikhe, Avash, et al.
Publicado: (2025)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
por: Sui, Yuan, et al.
Publicado: (2024)
por: Sui, Yuan, et al.
Publicado: (2024)
Large Language Model Agents Are Not Always Faithful Self-Evolvers
por: Zhao, Weixiang, et al.
Publicado: (2026)
por: Zhao, Weixiang, et al.
Publicado: (2026)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
por: Gui, Runquan, et al.
Publicado: (2026)
por: Gui, Runquan, et al.
Publicado: (2026)
Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
por: Ruis, Laura, et al.
Publicado: (2024)
por: Ruis, Laura, et al.
Publicado: (2024)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
por: Sun, Zhouhao, et al.
Publicado: (2024)
por: Sun, Zhouhao, et al.
Publicado: (2024)
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
por: Sun, Chung-En, et al.
Publicado: (2025)
por: Sun, Chung-En, et al.
Publicado: (2025)
Closing the Confidence-Faithfulness Gap in Large Language Models
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
What Are the Odds? Language Models Are Capable of Probabilistic Reasoning
por: Paruchuri, Akshay, et al.
Publicado: (2024)
por: Paruchuri, Akshay, et al.
Publicado: (2024)
Investigating Training and Generalization in Faithful Self-Explanations of Large Language Models
por: Doi, Tomoki, et al.
Publicado: (2025)
por: Doi, Tomoki, et al.
Publicado: (2025)
Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?
por: Yona, Gal, et al.
Publicado: (2024)
por: Yona, Gal, et al.
Publicado: (2024)
Simplifying Safety Proofs with Forward-Backward Reasoning and Prophecy
por: Frenkel, Eden, et al.
Publicado: (2026)
por: Frenkel, Eden, et al.
Publicado: (2026)
Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps
por: Tutek, Martin, et al.
Publicado: (2025)
por: Tutek, Martin, et al.
Publicado: (2025)
Towards Transparent AI: A Survey on Explainable Language Models
por: Palikhe, Avash, et al.
Publicado: (2025)
por: Palikhe, Avash, et al.
Publicado: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
por: Xu, Fengli, et al.
Publicado: (2025)
por: Xu, Fengli, et al.
Publicado: (2025)
Federated Concept-Based Models: Interpretable models with distributed supervision
por: Fenoglio, Dario, et al.
Publicado: (2026)
por: Fenoglio, Dario, et al.
Publicado: (2026)
What Makes Large Language Models Reason in (Multi-Turn) Code Generation?
por: Zheng, Kunhao, et al.
Publicado: (2024)
por: Zheng, Kunhao, et al.
Publicado: (2024)
Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models
por: Zhang, Zhenliang, et al.
Publicado: (2025)
por: Zhang, Zhenliang, et al.
Publicado: (2025)
Ejemplares similares
-
Federated Behavioural Planes: Explaining the Evolution of Client Behaviour in Federated Learning
por: Fenoglio, Dario, et al.
Publicado: (2024) -
Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation
por: Sovrano, Francesco, et al.
Publicado: (2026) -
Counterfactual Concept Bottleneck Models
por: Dominici, Gabriele, et al.
Publicado: (2024) -
Evaluating Explanations Through LLMs: Beyond Traditional User Studies
por: De Bona, Francesco Bombassei, et al.
Publicado: (2024) -
Instruction Adherence in Coding Agent Configuration Files: A Factorial Study of Four File-Structure Variables
por: McMillan, Damon
Publicado: (2026)