Hallucination Detection via Activations of Open-Weight Proxy Analyzers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singh, Akshita, Paudel, Prabesh, Roy, Siddhartha |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
par: Samadi, Mehrzad, et autres
Publié: (2025)
par: Samadi, Mehrzad, et autres
Publié: (2025)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025)
par: Butler, Landon, et autres
Publié: (2025)
Bolster Hallucination Detection via Prompt-Guided Data Augmentation
par: Li, Wenyun, et autres
Publié: (2025)
par: Li, Wenyun, et autres
Publié: (2025)
Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning
par: Kabra, Sanchit, et autres
Publié: (2025)
par: Kabra, Sanchit, et autres
Publié: (2025)
Principled Detection of Hallucinations in Large Language Models via Multiple Testing
par: Li, Jiawei, et autres
Publié: (2025)
par: Li, Jiawei, et autres
Publié: (2025)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
par: Zhu, Yu, et autres
Publié: (2024)
par: Zhu, Yu, et autres
Publié: (2024)
Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies
par: Song, Jingze, et autres
Publié: (2026)
par: Song, Jingze, et autres
Publié: (2026)
Learning to Reason for Hallucination Span Detection
par: Su, Hsuan, et autres
Publié: (2025)
par: Su, Hsuan, et autres
Publié: (2025)
Steer LLM Latents for Hallucination Detection
par: Park, Seongheon, et autres
Publié: (2025)
par: Park, Seongheon, et autres
Publié: (2025)
Cost-Effective Hallucination Detection for LLMs
par: Valentin, Simon, et autres
Publié: (2024)
par: Valentin, Simon, et autres
Publié: (2024)
HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
par: Liu, Emmy, et autres
Publié: (2026)
par: Liu, Emmy, et autres
Publié: (2026)
KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking
par: Zhang, Jiawei, et autres
Publié: (2024)
par: Zhang, Jiawei, et autres
Publié: (2024)
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)
par: Kulkarni, Atharva, et autres
Publié: (2025)
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
par: Yao, Siyang, et autres
Publié: (2026)
par: Yao, Siyang, et autres
Publié: (2026)
HalluGraph: Auditable Hallucination Detection for Legal RAG Systems via Knowledge Graph Alignment
par: Noël, Valentin, et autres
Publié: (2025)
par: Noël, Valentin, et autres
Publié: (2025)
Tamper-Resistant Safeguards for Open-Weight LLMs
par: Tamirisa, Rishub, et autres
Publié: (2024)
par: Tamirisa, Rishub, et autres
Publié: (2024)
The Illusion of Progress: Re-evaluating Hallucination Detection in LLMs
par: Janiak, Denis, et autres
Publié: (2025)
par: Janiak, Denis, et autres
Publié: (2025)
Hallucinated Span Detection with Multi-View Attention Features
par: Ogasa, Yuya, et autres
Publié: (2025)
par: Ogasa, Yuya, et autres
Publié: (2025)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Ten Words Only Still Help: Improving Black-Box AI-Generated Text Detection via Proxy-Guided Efficient Re-Sampling
par: Shi, Yuhui, et autres
Publié: (2024)
par: Shi, Yuhui, et autres
Publié: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
par: Min, Rui, et autres
Publié: (2026)
par: Min, Rui, et autres
Publié: (2026)
HD-NDEs: Neural Differential Equations for Hallucination Detection in LLMs
par: Li, Qing, et autres
Publié: (2025)
par: Li, Qing, et autres
Publié: (2025)
(Im)possibility of Automated Hallucination Detection in Large Language Models
par: Karbasi, Amin, et autres
Publié: (2025)
par: Karbasi, Amin, et autres
Publié: (2025)
Hallucination Detection in LLMs Using Spectral Features of Attention Maps
par: Binkowski, Jakub, et autres
Publié: (2025)
par: Binkowski, Jakub, et autres
Publié: (2025)
Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs
par: Kossen, Jannik, et autres
Publié: (2024)
par: Kossen, Jannik, et autres
Publié: (2024)
Real-Time Detection of Hallucinated Entities in Long-Form Generation
par: Obeso, Oscar, et autres
Publié: (2025)
par: Obeso, Oscar, et autres
Publié: (2025)
Training Language Models on the Knowledge Graph: Insights on Hallucinations and Their Detectability
par: Hron, Jiri, et autres
Publié: (2024)
par: Hron, Jiri, et autres
Publié: (2024)
Manifold-based Sampling for In-Context Hallucination Detection in Large Language Models
par: Vamshi, Bodla Krishna, et autres
Publié: (2026)
par: Vamshi, Bodla Krishna, et autres
Publié: (2026)
Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps
par: Waldendorf, Jonas, et autres
Publié: (2026)
par: Waldendorf, Jonas, et autres
Publié: (2026)
FRED: Financial Retrieval-Enhanced Detection and Editing of Hallucinations in Language Models
par: Tan, Likun, et autres
Publié: (2025)
par: Tan, Likun, et autres
Publié: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
par: Mündler, Niels, et autres
Publié: (2023)
par: Mündler, Niels, et autres
Publié: (2023)
SLM Meets LLM: Balancing Latency, Interpretability and Consistency in Hallucination Detection
par: Hu, Mengya, et autres
Publié: (2024)
par: Hu, Mengya, et autres
Publié: (2024)
Hallucination Detection in LLMs: Fast and Memory-Efficient Fine-Tuned Models
par: Arteaga, Gabriel Y., et autres
Publié: (2024)
par: Arteaga, Gabriel Y., et autres
Publié: (2024)
COUNTDOWN: Contextually Sparse Activation Filtering Out Unnecessary Weights in Down Projection
par: Cheon, Jaewon, et autres
Publié: (2025)
par: Cheon, Jaewon, et autres
Publié: (2025)
Detection Without Correction: A Robust Asymmetry in Activation-Based Hallucination Probing
par: Roy, Dip, et autres
Publié: (2026)
par: Roy, Dip, et autres
Publié: (2026)
The Phenomenology of Hallucinations
par: Ruscio, Valeria, et autres
Publié: (2026)
par: Ruscio, Valeria, et autres
Publié: (2026)
Rethinking the Role of Proxy Rewards in Language Model Alignment
par: Kim, Sungdong, et autres
Publié: (2024)
par: Kim, Sungdong, et autres
Publié: (2024)
IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference
par: Liu, Guanming, et autres
Publié: (2026)
par: Liu, Guanming, et autres
Publié: (2026)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
par: Li, Yuangang, et autres
Publié: (2025)
par: Li, Yuangang, et autres
Publié: (2025)
Documents similaires
-
Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
par: Samadi, Mehrzad, et autres
Publié: (2025) -
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025) -
Bolster Hallucination Detection via Prompt-Guided Data Augmentation
par: Li, Wenyun, et autres
Publié: (2025) -
Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning
par: Kabra, Sanchit, et autres
Publié: (2025) -
Principled Detection of Hallucinations in Large Language Models via Multiple Testing
par: Li, Jiawei, et autres
Publié: (2025)