Detection Without Correction: A Robust Asymmetry in Activation-Based Hallucination Probing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roy, Dip, Misra, Rajiv, Singh, Sanjay Kumar, Roy, Anisha |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Multi-Level Causal Intervention Framework for Mechanistic Interpretability in Variational Autoencoders
par: Roy, Dip, et autres
Publié: (2025)
par: Roy, Dip, et autres
Publié: (2025)
Posterior-Calibrated Causal Circuits in Variational Autoencoders: Why Image-Domain Interpretability Fails on Tabular Data
par: Roy, Dip, et autres
Publié: (2026)
par: Roy, Dip, et autres
Publié: (2026)
Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse
par: Roy, Dip, et autres
Publié: (2026)
par: Roy, Dip, et autres
Publié: (2026)
MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement
par: Roy, Anisha, et autres
Publié: (2026)
par: Roy, Anisha, et autres
Publié: (2026)
Hallucination Detection via Activations of Open-Weight Proxy Analyzers
par: Singh, Akshita, et autres
Publié: (2026)
par: Singh, Akshita, et autres
Publié: (2026)
Bayesian Autoencoder for Medical Anomaly Detection: Uncertainty-Aware Approach for Brain 2 MRI Analysis
par: Roy, Dip
Publié: (2025)
par: Roy, Dip
Publié: (2025)
Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs
par: Kossen, Jannik, et autres
Publié: (2024)
par: Kossen, Jannik, et autres
Publié: (2024)
Temporal Graph Network: Hallucination Detection in Multi-Turn Conversation
par: Rathore, Vidhi, et autres
Publié: (2026)
par: Rathore, Vidhi, et autres
Publié: (2026)
Detecting Token-Level Hallucinations Using Variance Signals: A Reference-Free Approach
par: Kumar, Keshav
Publié: (2025)
par: Kumar, Keshav
Publié: (2025)
GPT-3 Powered Information Extraction for Building Robust Knowledge Bases
par: Choudhury, Ritabrata Roy, et autres
Publié: (2024)
par: Choudhury, Ritabrata Roy, et autres
Publié: (2024)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
par: Zhou, Hanhan, et autres
Publié: (2026)
par: Zhou, Hanhan, et autres
Publié: (2026)
MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection
par: Saha, Anisha, et autres
Publié: (2025)
par: Saha, Anisha, et autres
Publié: (2025)
Temporal Alignment of Time Sensitive Facts with Activation Engineering
par: Govindan, Sanjay, et autres
Publié: (2025)
par: Govindan, Sanjay, et autres
Publié: (2025)
Hallucination is Inevitable: An Innate Limitation of Large Language Models
par: Xu, Ziwei, et autres
Publié: (2024)
par: Xu, Ziwei, et autres
Publié: (2024)
Supporting Assessment of Novelty of Design Problems Using Concept of Problem SAPPhIRE
par: Singh, Sanjay, et autres
Publié: (2024)
par: Singh, Sanjay, et autres
Publié: (2024)
Security Without Detection: Economic Denial as a Primitive for Edge and IoT Defense
par: Singh, Samaresh Kumar, et autres
Publié: (2025)
par: Singh, Samaresh Kumar, et autres
Publié: (2025)
Generalization Gaps in Political Fake News Detection: An Empirical Study on the LIAR Dataset
par: Hasan, S Mahmudul, et autres
Publié: (2025)
par: Hasan, S Mahmudul, et autres
Publié: (2025)
Prompt-Based Bias Calibration for Better Zero/Few-Shot Learning of Language Models
par: He, Kang, et autres
Publié: (2024)
par: He, Kang, et autres
Publié: (2024)
A Survey on Automatic Online Hate Speech Detection in Low-Resource Languages
par: Das, Susmita, et autres
Publié: (2024)
par: Das, Susmita, et autres
Publié: (2024)
Detecting AI Hallucinations in Finance: An Information-Theoretic Method Cuts Hallucination Rate by 92%
par: Singha, Mainak
Publié: (2025)
par: Singha, Mainak
Publié: (2025)
HU at SemEval-2024 Task 8A: Can Contrastive Learning Learn Embeddings to Detect Machine-Generated Text?
par: Dipta, Shubhashis Roy, et autres
Publié: (2024)
par: Dipta, Shubhashis Roy, et autres
Publié: (2024)
HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection
par: Du, Xuefeng, et autres
Publié: (2024)
par: Du, Xuefeng, et autres
Publié: (2024)
Leveraging Graph Structures to Detect Hallucinations in Large Language Models
par: Nonkes, Noa, et autres
Publié: (2024)
par: Nonkes, Noa, et autres
Publié: (2024)
MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations
par: Mitsuzawa, Kensuke, et autres
Publié: (2025)
par: Mitsuzawa, Kensuke, et autres
Publié: (2025)
Wisdom of the Crowds in Forecasting: Forecast Summarization for Supporting Future Event Prediction
par: Saha, Anisha, et autres
Publié: (2025)
par: Saha, Anisha, et autres
Publié: (2025)
ZClip: Adaptive Spike Mitigation for LLM Pre-Training
par: Kumar, Abhay, et autres
Publié: (2025)
par: Kumar, Abhay, et autres
Publié: (2025)
Variance Control via Weight Rescaling in LLM Pre-training
par: Owen, Louis, et autres
Publié: (2025)
par: Owen, Louis, et autres
Publié: (2025)
SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution
par: He, Kang, et autres
Publié: (2026)
par: He, Kang, et autres
Publié: (2026)
TraceNAS: Zero-shot LLM Pruning via Gradient Trace Correlation
par: Malettira, Prajna G., et autres
Publié: (2026)
par: Malettira, Prajna G., et autres
Publié: (2026)
Lost in State Space: Probing Frozen Mamba Representations
par: Wagh, Bhagyashree, et autres
Publié: (2026)
par: Wagh, Bhagyashree, et autres
Publié: (2026)
Detecting and Preventing Hallucinations in Large Vision Language Models
par: Gunjal, Anisha, et autres
Publié: (2023)
par: Gunjal, Anisha, et autres
Publié: (2023)
RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration
par: Ridder, Fabian, et autres
Publié: (2026)
par: Ridder, Fabian, et autres
Publié: (2026)
Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
par: Binkowski, Jakub, et autres
Publié: (2026)
par: Binkowski, Jakub, et autres
Publié: (2026)
InterrogateLLM: Zero-Resource Hallucination Detection in LLM-Generated Answers
par: Yehuda, Yakir, et autres
Publié: (2024)
par: Yehuda, Yakir, et autres
Publié: (2024)
Beyond ROUGE: N-Gram Subspace Features for LLM Hallucination Detection
par: Li, Jerry, et autres
Publié: (2025)
par: Li, Jerry, et autres
Publié: (2025)
A Unified Definition of Hallucination: It's The World Model, Stupid!
par: Liu, Emmy, et autres
Publié: (2025)
par: Liu, Emmy, et autres
Publié: (2025)
A Robust Autoencoder Ensemble-Based Approach for Anomaly Detection in Text
par: Pantin, Jeremie, et autres
Publié: (2024)
par: Pantin, Jeremie, et autres
Publié: (2024)
HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
par: Liu, Emmy, et autres
Publié: (2026)
par: Liu, Emmy, et autres
Publié: (2026)
Why Fine-Tuning Encourages Hallucinations and How to Fix It
par: Kaplan, Guy, et autres
Publié: (2026)
par: Kaplan, Guy, et autres
Publié: (2026)
Learning to Reason for Hallucination Span Detection
par: Su, Hsuan, et autres
Publié: (2025)
par: Su, Hsuan, et autres
Publié: (2025)
Documents similaires
-
A Multi-Level Causal Intervention Framework for Mechanistic Interpretability in Variational Autoencoders
par: Roy, Dip, et autres
Publié: (2025) -
Posterior-Calibrated Causal Circuits in Variational Autoencoders: Why Image-Domain Interpretability Fails on Tabular Data
par: Roy, Dip, et autres
Publié: (2026) -
Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse
par: Roy, Dip, et autres
Publié: (2026) -
MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement
par: Roy, Anisha, et autres
Publié: (2026) -
Hallucination Detection via Activations of Open-Weight Proxy Analyzers
par: Singh, Akshita, et autres
Publié: (2026)