Still No Lie Detector for Language Models: Probing Empirical and Conceptual Roadblocks
Fuente:
arXiv
Salvato in:
| Autori principali: | Levinstein, B. A., Herrmann, Daniel A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Probing the Limits of the Lie Detector Approach to LLM Deception
di: Berger, Tom-Felix
Pubblicazione: (2026)
di: Berger, Tom-Felix
Pubblicazione: (2026)
Language Models Optimized to Fool Detectors Still Have a Distinct Style (And How to Change It)
di: Soto, Rafael Rivera, et al.
Pubblicazione: (2025)
di: Soto, Rafael Rivera, et al.
Pubblicazione: (2025)
Erasing Conceptual Knowledge from Language Models
di: Gandikota, Rohit, et al.
Pubblicazione: (2024)
di: Gandikota, Rohit, et al.
Pubblicazione: (2024)
Still "Talking About Large Language Models": Some Clarifications
di: Shanahan, Murray
Pubblicazione: (2024)
di: Shanahan, Murray
Pubblicazione: (2024)
An Empirical Study of Mamba-based Language Models
di: Waleffe, Roger, et al.
Pubblicazione: (2024)
di: Waleffe, Roger, et al.
Pubblicazione: (2024)
Smaller Language Models are Better Black-box Machine-Generated Text Detectors
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2023)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2023)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
Temporally Consistent Factuality Probing for Large Language Models
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
An Empirical Comparison of Vocabulary Expansion and Initialization Approaches for Language Models
di: Mundra, Nandini, et al.
Pubblicazione: (2024)
di: Mundra, Nandini, et al.
Pubblicazione: (2024)
Assessing Adversarial Robustness of Large Language Models: An Empirical Study
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
Comparing Template-based and Template-free Language Model Probing
di: Shaier, Sagi, et al.
Pubblicazione: (2024)
di: Shaier, Sagi, et al.
Pubblicazione: (2024)
Monitoring Latent World States in Language Models with Propositional Probes
di: Feng, Jiahai, et al.
Pubblicazione: (2024)
di: Feng, Jiahai, et al.
Pubblicazione: (2024)
Universal Conceptual Structure in Neural Translation: Probing NLLB-200's Multilingual Geometry
di: Mathewson, Kyle Elliott
Pubblicazione: (2026)
di: Mathewson, Kyle Elliott
Pubblicazione: (2026)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2026)
di: Wang, Qianli, et al.
Pubblicazione: (2026)
An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models
di: Luo, Hanrui, et al.
Pubblicazione: (2026)
di: Luo, Hanrui, et al.
Pubblicazione: (2026)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
di: Lee, Kunil, et al.
Pubblicazione: (2026)
di: Lee, Kunil, et al.
Pubblicazione: (2026)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
di: Abouzahir, Chaimae, et al.
Pubblicazione: (2026)
di: Abouzahir, Chaimae, et al.
Pubblicazione: (2026)
Probing Cultural Signals in Large Language Models through Author Profiling
di: Lafargue, Valentin, et al.
Pubblicazione: (2026)
di: Lafargue, Valentin, et al.
Pubblicazione: (2026)
Empirical Analysis of Efficient Fine-Tuning Methods for Large Pre-Trained Language Models
di: Doering, Nigel, et al.
Pubblicazione: (2024)
di: Doering, Nigel, et al.
Pubblicazione: (2024)
Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
From Imitation to Introspection: Probing Self-Consciousness in Language Models
di: Chen, Sirui, et al.
Pubblicazione: (2024)
di: Chen, Sirui, et al.
Pubblicazione: (2024)
Detecting Conceptual Abstraction in LLMs
di: Regneri, Michaela, et al.
Pubblicazione: (2024)
di: Regneri, Michaela, et al.
Pubblicazione: (2024)
Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
di: Visser, Ruan, et al.
Pubblicazione: (2026)
di: Visser, Ruan, et al.
Pubblicazione: (2026)
Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures
di: Grover, Kabir
Pubblicazione: (2026)
di: Grover, Kabir
Pubblicazione: (2026)
Small Models Are (Still) Effective Cross-Domain Argument Extractors
di: Gantt, William, et al.
Pubblicazione: (2024)
di: Gantt, William, et al.
Pubblicazione: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
Editing Conceptual Knowledge for Large Language Models
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
CURE: Controlled Unlearning for Robust Embeddings -- Mitigating Conceptual Shortcuts in Pre-Trained Language Models
di: Kocak, Aysenur, et al.
Pubblicazione: (2025)
di: Kocak, Aysenur, et al.
Pubblicazione: (2025)
When Attention Sink Emerges in Language Models: An Empirical View
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
The Zero Body Problem: Probing LLM Use of Sensory Language
di: Hicke, Rebecca M. M., et al.
Pubblicazione: (2025)
di: Hicke, Rebecca M. M., et al.
Pubblicazione: (2025)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
di: Zhang, Andi, et al.
Pubblicazione: (2024)
di: Zhang, Andi, et al.
Pubblicazione: (2024)
What Large Language Models Do Not Talk About: An Empirical Study of Moderation and Censorship Practices
di: Noels, Sander, et al.
Pubblicazione: (2025)
di: Noels, Sander, et al.
Pubblicazione: (2025)
FacLens: Transferable Probe for Foreseeing Non-Factuality in Fact-Seeking Question Answering of Large Language Models
di: Wang, Yanling, et al.
Pubblicazione: (2024)
di: Wang, Yanling, et al.
Pubblicazione: (2024)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
di: Li, Daoyang, et al.
Pubblicazione: (2024)
di: Li, Daoyang, et al.
Pubblicazione: (2024)
Science is Exploration: Computational Frontiers for Conceptual Metaphor Theory
di: Hicke, Rebecca M. M., et al.
Pubblicazione: (2024)
di: Hicke, Rebecca M. M., et al.
Pubblicazione: (2024)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
di: Zhu, Kaijie, et al.
Pubblicazione: (2024)
di: Zhu, Kaijie, et al.
Pubblicazione: (2024)
Probing the Decision Boundaries of In-context Learning in Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2024)
di: Zhao, Siyan, et al.
Pubblicazione: (2024)
Empirical Comparison of Encoder-Based Language Models and Feature-Based Supervised Machine Learning Approaches to Automated Scoring of Long Essays
di: Wang, Kuo, et al.
Pubblicazione: (2026)
di: Wang, Kuo, et al.
Pubblicazione: (2026)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
A Conceptual Framework For Trie-Augmented Neural Networks (TANNS)
di: Adefemi, Temitayo
Pubblicazione: (2024)
di: Adefemi, Temitayo
Pubblicazione: (2024)
Documenti analoghi
-
Probing the Limits of the Lie Detector Approach to LLM Deception
di: Berger, Tom-Felix
Pubblicazione: (2026) -
Language Models Optimized to Fool Detectors Still Have a Distinct Style (And How to Change It)
di: Soto, Rafael Rivera, et al.
Pubblicazione: (2025) -
Erasing Conceptual Knowledge from Language Models
di: Gandikota, Rohit, et al.
Pubblicazione: (2024) -
Still "Talking About Large Language Models": Some Clarifications
di: Shanahan, Murray
Pubblicazione: (2024) -
An Empirical Study of Mamba-based Language Models
di: Waleffe, Roger, et al.
Pubblicazione: (2024)