ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhenliang, Hu, Xinyu, Zhang, Huixuan, Zhang, Junzhe, Wan, Xiaojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025)
par: Jia, Boyu, et autres
Publié: (2025)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
par: Zhang, Huixuan, et autres
Publié: (2023)
par: Zhang, Huixuan, et autres
Publié: (2023)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query Generation
par: Xu, Fan, et autres
Publié: (2025)
par: Xu, Fan, et autres
Publié: (2025)
Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models
par: Zhang, Zhenliang, et autres
Publié: (2025)
par: Zhang, Zhenliang, et autres
Publié: (2025)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
SCOPE: Intrinsic Semantic Space Control for Mitigating Copyright Infringement in LLMs
par: Zhang, Zhenliang, et autres
Publié: (2025)
par: Zhang, Zhenliang, et autres
Publié: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
Is LLMs Hallucination Usable? LLM-based Negative Reasoning for Fake News Detection
par: Zhang, Chaowei, et autres
Publié: (2025)
par: Zhang, Chaowei, et autres
Publié: (2025)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs
par: Kossen, Jannik, et autres
Publié: (2024)
par: Kossen, Jannik, et autres
Publié: (2024)
PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
par: Wu, Yuhe, et autres
Publié: (2026)
par: Wu, Yuhe, et autres
Publié: (2026)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry
par: Alvarez, Tyler, et autres
Publié: (2026)
par: Alvarez, Tyler, et autres
Publié: (2026)
Hallucination Detection with the Internal Layers of LLMs
par: Preiß, Martin
Publié: (2025)
par: Preiß, Martin
Publié: (2025)
Removal of Hallucination on Hallucination: Debate-Augmented RAG
par: Hu, Wentao, et autres
Publié: (2025)
par: Hu, Wentao, et autres
Publié: (2025)
Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
par: Zhang, Anqi, et autres
Publié: (2025)
par: Zhang, Anqi, et autres
Publié: (2025)
Neural Probe-Based Hallucination Detection for Large Language Models
par: Liang, Shize, et autres
Publié: (2025)
par: Liang, Shize, et autres
Publié: (2025)
Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models
par: Feng, Yijun
Publié: (2025)
par: Feng, Yijun
Publié: (2025)
Cross-Layer Attention Probing for Fine-Grained Hallucination Detection
par: Suresh, Malavika, et autres
Publié: (2025)
par: Suresh, Malavika, et autres
Publié: (2025)
The Two Sides of the Coin: Hallucination Generation and Detection with LLMs as Evaluators for LLMs
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
SINdex: Semantic INconsistency Index for Hallucination Detection in LLMs
par: Abdaljalil, Samir, et autres
Publié: (2025)
par: Abdaljalil, Samir, et autres
Publié: (2025)
Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
par: Bazarova, Alexandra, et autres
Publié: (2025)
par: Bazarova, Alexandra, et autres
Publié: (2025)
HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses
par: Lee, Sujeong, et autres
Publié: (2025)
par: Lee, Sujeong, et autres
Publié: (2025)
LRP4RAG: Detecting Hallucinations in Retrieval-Augmented Generation via Layer-wise Relevance Propagation
par: Hu, Haichuan, et autres
Publié: (2024)
par: Hu, Haichuan, et autres
Publié: (2024)
Can LLMs Detect Intrinsic Hallucinations in Paraphrasing and Machine Translation?
par: Gogoulou, Evangelia, et autres
Publié: (2025)
par: Gogoulou, Evangelia, et autres
Publié: (2025)
Graphing the Truth: Structured Visualizations for Automated Hallucination Detection in LLMs
par: Agrawal, Tanmay
Publié: (2025)
par: Agrawal, Tanmay
Publié: (2025)
ICR: Iterative Clarification and Rewriting for Conversational Search
par: Cao, Zhiyu, et autres
Publié: (2025)
par: Cao, Zhiyu, et autres
Publié: (2025)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
par: Li, Mingjie, et autres
Publié: (2026)
par: Li, Mingjie, et autres
Publié: (2026)
Cost-Effective Hallucination Detection for LLMs
par: Valentin, Simon, et autres
Publié: (2024)
par: Valentin, Simon, et autres
Publié: (2024)
Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models
par: Ju, Li, et autres
Publié: (2026)
par: Ju, Li, et autres
Publié: (2026)
When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs
par: Sun, Zhongxiang, et autres
Publié: (2026)
par: Sun, Zhongxiang, et autres
Publié: (2026)
Documents similaires
-
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025) -
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025) -
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
par: Zhang, Xu, et autres
Publié: (2025) -
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
par: Zhang, Huixuan, et autres
Publié: (2023) -
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)