Prompt-Guided Internal States for Hallucination Detection of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Fujie, Yu, Peiqi, Yi, Biao, Zhang, Baolei, Li, Tong, Liu, Zheli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024)
di: Yi, Biao, et al.
Pubblicazione: (2024)
Gradient Surgery for Safe LLM Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
di: Song, Yusheng, et al.
Pubblicazione: (2025)
di: Song, Yusheng, et al.
Pubblicazione: (2025)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Detection Method for Prompt Injection by Integrating Pre-trained Model and Heuristic Feature Engineering
di: Ji, Yi, et al.
Pubblicazione: (2025)
di: Ji, Yi, et al.
Pubblicazione: (2025)
Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models
di: Su, Weihang, et al.
Pubblicazione: (2024)
di: Su, Weihang, et al.
Pubblicazione: (2024)
Confabulation: The Surprising Value of Large Language Model Hallucinations
di: Sui, Peiqi, et al.
Pubblicazione: (2024)
di: Sui, Peiqi, et al.
Pubblicazione: (2024)
INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection
di: Chen, Chao, et al.
Pubblicazione: (2024)
di: Chen, Chao, et al.
Pubblicazione: (2024)
Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
di: van Dijk, Gijs
Pubblicazione: (2026)
di: van Dijk, Gijs
Pubblicazione: (2026)
Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
di: Binkowski, Jakub, et al.
Pubblicazione: (2026)
di: Binkowski, Jakub, et al.
Pubblicazione: (2026)
Knowledge Overshadowing Causes Amalgamated Hallucination in Large Language Models
di: Zhang, Yuji, et al.
Pubblicazione: (2024)
di: Zhang, Yuji, et al.
Pubblicazione: (2024)
Bolster Hallucination Detection via Prompt-Guided Data Augmentation
di: Li, Wenyun, et al.
Pubblicazione: (2025)
di: Li, Wenyun, et al.
Pubblicazione: (2025)
Hallucination Detection and Evaluation of Large Language Model
di: Zhang, Chenggong, et al.
Pubblicazione: (2025)
di: Zhang, Chenggong, et al.
Pubblicazione: (2025)
Enhancing Robustness in Large Language Models: Prompting for Mitigating the Impact of Irrelevant Information
di: Jiang, Ming, et al.
Pubblicazione: (2024)
di: Jiang, Ming, et al.
Pubblicazione: (2024)
Active Prompting with Chain-of-Thought for Large Language Models
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation
di: Cheng, Jiahao, et al.
Pubblicazione: (2025)
di: Cheng, Jiahao, et al.
Pubblicazione: (2025)
Mitigating Prompt-Induced Hallucinations in Large Language Models via Structured Reasoning
di: Hao, Jinbo, et al.
Pubblicazione: (2026)
di: Hao, Jinbo, et al.
Pubblicazione: (2026)
HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering
di: Tong, Chaodong, et al.
Pubblicazione: (2025)
di: Tong, Chaodong, et al.
Pubblicazione: (2025)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning
di: Liu, Langming, et al.
Pubblicazione: (2026)
di: Liu, Langming, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models
di: Li, Chaozhuo, et al.
Pubblicazione: (2025)
di: Li, Chaozhuo, et al.
Pubblicazione: (2025)
HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2026)
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2026)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
di: Zhang, Yue, et al.
Pubblicazione: (2023)
di: Zhang, Yue, et al.
Pubblicazione: (2023)
DecoPrompt : Decoding Prompts Reduces Hallucinations when Large Language Models Meet False Premises
di: Xu, Nan, et al.
Pubblicazione: (2024)
di: Xu, Nan, et al.
Pubblicazione: (2024)
Triggering Hallucinations in LLMs: A Quantitative Study of Prompt-Induced Hallucination in Large Language Models
di: Sato, Makoto
Pubblicazione: (2025)
di: Sato, Makoto
Pubblicazione: (2025)
Efficient Detection of Toxic Prompts in Large Language Models
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
HAD: HAllucination Detection Language Models Based on a Comprehensive Hallucination Taxonomy
di: Xu, Fan, et al.
Pubblicazione: (2025)
di: Xu, Fan, et al.
Pubblicazione: (2025)
Hallucination Detection with the Internal Layers of LLMs
di: Preiß, Martin
Pubblicazione: (2025)
di: Preiß, Martin
Pubblicazione: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
di: Liu, Biao, et al.
Pubblicazione: (2025)
di: Liu, Biao, et al.
Pubblicazione: (2025)
Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Models
di: Huang, Yanwen, et al.
Pubblicazione: (2025)
di: Huang, Yanwen, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
CCNU at SemEval-2025 Task 3: Leveraging Internal and External Knowledge of Large Language Models for Multilingual Hallucination Annotation
di: Liu, Xu, et al.
Pubblicazione: (2025)
di: Liu, Xu, et al.
Pubblicazione: (2025)
Calibrating Reasoning in Language Models with Internal Consistency
di: Xie, Zhihui, et al.
Pubblicazione: (2024)
di: Xie, Zhihui, et al.
Pubblicazione: (2024)
Prompt-Response Semantic Divergence Metrics for Faithfulness Hallucination and Misalignment Detection in Large Language Models
di: Halperin, Igor
Pubblicazione: (2025)
di: Halperin, Igor
Pubblicazione: (2025)
Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding
di: Xu, Derong, et al.
Pubblicazione: (2024)
di: Xu, Derong, et al.
Pubblicazione: (2024)
Practical Framework for Privacy-Preserving and Byzantine-robust Federated Learning
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025) -
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024) -
Gradient Surgery for Safe LLM Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025) -
Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
di: Song, Yusheng, et al.
Pubblicazione: (2025) -
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)