ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Chung-En, Yan, Ge, Kulkarni, Akshay, Weng, Tsui-Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
von: Sun, Chung-En, et al.
Veröffentlicht: (2025)
von: Sun, Chung-En, et al.
Veröffentlicht: (2025)
Crafting Large Language Models for Enhanced Interpretability
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
Interpretable Generative Models through Post-hoc Concept Bottlenecks
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2025)
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2025)
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
von: Sun, Chung-En, et al.
Veröffentlicht: (2026)
von: Sun, Chung-En, et al.
Veröffentlicht: (2026)
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
von: Oikarinen, Tuomas, et al.
Veröffentlicht: (2025)
von: Oikarinen, Tuomas, et al.
Veröffentlicht: (2025)
Steer2Edit: From Activation Steering to Component-Level Editing
von: Sun, Chung-En, et al.
Veröffentlicht: (2026)
von: Sun, Chung-En, et al.
Veröffentlicht: (2026)
Concept Bottleneck Large Language Models
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
von: Yan, Ge, et al.
Veröffentlicht: (2025)
von: Yan, Ge, et al.
Veröffentlicht: (2025)
Interpretability-Guided Test-Time Adversarial Defense
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2024)
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2024)
Effective Skill Unlearning through Intervention and Abstention
von: Li, Yongce, et al.
Veröffentlicht: (2025)
von: Li, Yongce, et al.
Veröffentlicht: (2025)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
von: Luo, Linhao, et al.
Veröffentlicht: (2023)
von: Luo, Linhao, et al.
Veröffentlicht: (2023)
Interpreting Neurons in Deep Vision Networks with Language Models
von: Bai, Nicholas, et al.
Veröffentlicht: (2024)
von: Bai, Nicholas, et al.
Veröffentlicht: (2024)
Synchronous Faithfulness Monitoring for Trustworthy Retrieval-Augmented Generation
von: Wu, Di, et al.
Veröffentlicht: (2024)
von: Wu, Di, et al.
Veröffentlicht: (2024)
ReflCtrl: Controlling LLM Reflection via Representation Engineering
von: Yan, Ge, et al.
Veröffentlicht: (2025)
von: Yan, Ge, et al.
Veröffentlicht: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
von: Sun, Zhongxiang, et al.
Veröffentlicht: (2025)
von: Sun, Zhongxiang, et al.
Veröffentlicht: (2025)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models
von: Agarwal, Chirag, et al.
Veröffentlicht: (2024)
von: Agarwal, Chirag, et al.
Veröffentlicht: (2024)
FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation
von: Shum, KaShun, et al.
Veröffentlicht: (2024)
von: Shum, KaShun, et al.
Veröffentlicht: (2024)
Graph-constrained Reasoning: Faithful Reasoning on Knowledge Graphs with Large Language Models
von: Luo, Linhao, et al.
Veröffentlicht: (2024)
von: Luo, Linhao, et al.
Veröffentlicht: (2024)
On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models
von: Tanneru, Sree Harsha, et al.
Veröffentlicht: (2024)
von: Tanneru, Sree Harsha, et al.
Veröffentlicht: (2024)
Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
von: Ding, Kexin, et al.
Veröffentlicht: (2025)
von: Ding, Kexin, et al.
Veröffentlicht: (2025)
Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
von: McMillan, Teague, et al.
Veröffentlicht: (2025)
von: McMillan, Teague, et al.
Veröffentlicht: (2025)
Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions
von: Bao, Yuntai, et al.
Veröffentlicht: (2026)
von: Bao, Yuntai, et al.
Veröffentlicht: (2026)
Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation
von: Khan, Eeham, et al.
Veröffentlicht: (2026)
von: Khan, Eeham, et al.
Veröffentlicht: (2026)
Information Re-Organization Improves Reasoning in Large Language Models
von: Cheng, Xiaoxia, et al.
Veröffentlicht: (2024)
von: Cheng, Xiaoxia, et al.
Veröffentlicht: (2024)
RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models
von: Han, Yunseok, et al.
Veröffentlicht: (2026)
von: Han, Yunseok, et al.
Veröffentlicht: (2026)
BIRD: A Trustworthy Bayesian Inference Framework for Large Language Models
von: Feng, Yu, et al.
Veröffentlicht: (2024)
von: Feng, Yu, et al.
Veröffentlicht: (2024)
ReFF: Reinforcing Format Faithfulness in Language Models across Varied Tasks
von: Yao, Jiashu, et al.
Veröffentlicht: (2024)
von: Yao, Jiashu, et al.
Veröffentlicht: (2024)
Interpretable and Steerable Concept Bottleneck Sparse Autoencoders
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2025)
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2025)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
von: Gui, Runquan, et al.
Veröffentlicht: (2026)
von: Gui, Runquan, et al.
Veröffentlicht: (2026)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning
von: Das, Debrup, et al.
Veröffentlicht: (2024)
von: Das, Debrup, et al.
Veröffentlicht: (2024)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
von: Sun, Ruoyu, et al.
Veröffentlicht: (2025)
von: Sun, Ruoyu, et al.
Veröffentlicht: (2025)
RAT: Boosting Misclassification Detection Ability without Extra Data
von: Yan, Ge, et al.
Veröffentlicht: (2025)
von: Yan, Ge, et al.
Veröffentlicht: (2025)
Mapping Faithful Reasoning in Language Models
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2024)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2024)
How Interpretable are Reasoning Explanations from Prompting Large Language Models?
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2024)
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2024)
TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning
von: Yang, Yujiao
Veröffentlicht: (2026)
von: Yang, Yujiao
Veröffentlicht: (2026)
TrustLLM: Trustworthiness in Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
von: Sun, Chung-En, et al.
Veröffentlicht: (2025) -
Crafting Large Language Models for Enhanced Interpretability
von: Sun, Chung-En, et al.
Veröffentlicht: (2024) -
Interpretable Generative Models through Post-hoc Concept Bottlenecks
von: Kulkarni, Akshay, et al.
Veröffentlicht: (2025) -
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
von: Sun, Chung-En, et al.
Veröffentlicht: (2026) -
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
von: Oikarinen, Tuomas, et al.
Veröffentlicht: (2025)