ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Dasgupta, Sharanya, Basu, Arkaprabha, Nath, Sujoy, Das, Swagatam |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs
by: Nath, Sujoy, et al.
Published: (2025)
by: Nath, Sujoy, et al.
Published: (2025)
HalluShift: Measuring Distribution Shifts towards Hallucination Detection in LLMs
by: Dasgupta, Sharanya, et al.
Published: (2025)
by: Dasgupta, Sharanya, et al.
Published: (2025)
Fortifying Fully Convolutional Generative Adversarial Networks for Image Super-Resolution Using Divergence Measures
by: Basu, Arkaprabha, et al.
Published: (2024)
by: Basu, Arkaprabha, et al.
Published: (2024)
On Robust Cross Domain Alignment
by: Chakrabarty, Anish, et al.
Published: (2024)
by: Chakrabarty, Anish, et al.
Published: (2024)
Representational and Behavioral Stability of Truth in Large Language Models
by: Dies, Samantha, et al.
Published: (2025)
by: Dies, Samantha, et al.
Published: (2025)
Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context
by: Das, Nilanjana, et al.
Published: (2024)
by: Das, Nilanjana, et al.
Published: (2024)
Revealing the Ancient Beauty: Digital Reconstruction of Temple Tiles using Computer Vision
by: Basu, Arkaprabha
Published: (2025)
by: Basu, Arkaprabha
Published: (2025)
Enhanced Language Model Truthfulness with Learnable Intervention and Uncertainty Expression
by: Bayat, Farima Fatahi, et al.
Published: (2024)
by: Bayat, Farima Fatahi, et al.
Published: (2024)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
by: Diao, Muxi, et al.
Published: (2024)
by: Diao, Muxi, et al.
Published: (2024)
KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
by: Vazhentsev, Artem, et al.
Published: (2024)
by: Vazhentsev, Artem, et al.
Published: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
by: Wang, Zizhao, et al.
Published: (2025)
by: Wang, Zizhao, et al.
Published: (2025)
Exploring Safety-Utility Trade-Offs in Personalized Language Models
by: Vijjini, Anvesh Rao, et al.
Published: (2024)
by: Vijjini, Anvesh Rao, et al.
Published: (2024)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
by: Yin, Fan, et al.
Published: (2024)
by: Yin, Fan, et al.
Published: (2024)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
by: Zhang, Shaolei, et al.
Published: (2024)
by: Zhang, Shaolei, et al.
Published: (2024)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
by: Chen, Zhongzhi, et al.
Published: (2023)
by: Chen, Zhongzhi, et al.
Published: (2023)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
by: Wang, Keyu, et al.
Published: (2025)
by: Wang, Keyu, et al.
Published: (2025)
Resilience of Large Language Models for Noisy Instructions
by: Wang, Bin, et al.
Published: (2024)
by: Wang, Bin, et al.
Published: (2024)
SafetyBench: Evaluating the Safety of Large Language Models
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
Battling Misinformation: An Empirical Study on Adversarial Factuality in Open-Source Large Language Models
by: Sakib, Shahnewaz Karim, et al.
Published: (2025)
by: Sakib, Shahnewaz Karim, et al.
Published: (2025)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
by: Li, Xuying, et al.
Published: (2024)
by: Li, Xuying, et al.
Published: (2024)
Ranking Large Language Models without Ground Truth
by: Dhurandhar, Amit, et al.
Published: (2024)
by: Dhurandhar, Amit, et al.
Published: (2024)
Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents
by: He, Haorui, et al.
Published: (2025)
by: He, Haorui, et al.
Published: (2025)
Improving Factuality in Large Language Models via Decoding-Time Hallucinatory and Truthful Comparators
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models
by: Srey, Ponhvoan, et al.
Published: (2026)
by: Srey, Ponhvoan, et al.
Published: (2026)
Emergence of Linear Truth Encodings in Language Models
by: Ravfogel, Shauli, et al.
Published: (2025)
by: Ravfogel, Shauli, et al.
Published: (2025)
HindiLLM: Large Language Model for Hindi
by: Chouhan, Sanjay, et al.
Published: (2024)
by: Chouhan, Sanjay, et al.
Published: (2024)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
by: Goel, Naman
Published: (2023)
by: Goel, Naman
Published: (2023)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
by: Li, Jingru, et al.
Published: (2026)
by: Li, Jingru, et al.
Published: (2026)
Enhancing Safety of Large Language Models via Embedding Space Separation
by: Zhao, Xu, et al.
Published: (2026)
by: Zhao, Xu, et al.
Published: (2026)
Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models
by: Vazhentsev, Artem, et al.
Published: (2025)
by: Vazhentsev, Artem, et al.
Published: (2025)
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
To Tell The Truth: Language of Deception and Language Models
by: Hazra, Sanchaita, et al.
Published: (2023)
by: Hazra, Sanchaita, et al.
Published: (2023)
Confidence-Modulated Speculative Decoding for Large Language Models
by: Sen, Jaydip, et al.
Published: (2025)
by: Sen, Jaydip, et al.
Published: (2025)
Assessing Classical Machine Learning and Transformer-based Approaches for Detecting AI-Generated Research Text
by: Parimanoharan, Sharanya, et al.
Published: (2025)
by: Parimanoharan, Sharanya, et al.
Published: (2025)
Large Language Models Help Humans Verify Truthfulness -- Except When They Are Convincingly Wrong
by: Si, Chenglei, et al.
Published: (2023)
by: Si, Chenglei, et al.
Published: (2023)
Mitigating Exaggerated Safety in Large Language Models
by: Ray, Ruchira, et al.
Published: (2024)
by: Ray, Ruchira, et al.
Published: (2024)
RKEFino1: A Regulation Knowledge-Enhanced Large Language Model
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Robustness of Large Language Models Against Adversarial Attacks
by: Tao, Yiyi, et al.
Published: (2024)
by: Tao, Yiyi, et al.
Published: (2024)
Investigating Adversarial Trigger Transfer in Large Language Models
by: Meade, Nicholas, et al.
Published: (2024)
by: Meade, Nicholas, et al.
Published: (2024)
Similar Items
-
HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs
by: Nath, Sujoy, et al.
Published: (2025) -
HalluShift: Measuring Distribution Shifts towards Hallucination Detection in LLMs
by: Dasgupta, Sharanya, et al.
Published: (2025) -
Fortifying Fully Convolutional Generative Adversarial Networks for Image Super-Resolution Using Divergence Measures
by: Basu, Arkaprabha, et al.
Published: (2024) -
On Robust Cross Domain Alignment
by: Chakrabarty, Anish, et al.
Published: (2024) -
Representational and Behavioral Stability of Truth in Large Language Models
by: Dies, Samantha, et al.
Published: (2025)