Silenced Biases: The Dark Side LLMs Learned to Refuse
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Himelstein, Rom, LeVi, Amit, Youngmann, Brit, Nemcovsky, Yaniv, Mendelson, Avi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Silent Tokens, Loud Effects: Padding in LLMs
par: Himelstein, Rom, et autres
Publié: (2025)
par: Himelstein, Rom, et autres
Publié: (2025)
Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
par: Rahimi, Eliron, et autres
Publié: (2026)
par: Rahimi, Eliron, et autres
Publié: (2026)
Jailbreak Attack Initializations as Extractors of Compliance Directions
par: Levi, Amit, et autres
Publié: (2025)
par: Levi, Amit, et autres
Publié: (2025)
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
par: LeVi, Amit, et autres
Publié: (2025)
par: LeVi, Amit, et autres
Publié: (2025)
Representing LLMs in Prompt Semantic Task Space
par: Kashani, Idan, et autres
Publié: (2025)
par: Kashani, Idan, et autres
Publié: (2025)
Sparse patches adversarial attacks via extrapolating point-wise information
par: Nemcovsky, Yaniv, et autres
Publié: (2024)
par: Nemcovsky, Yaniv, et autres
Publié: (2024)
REMIND: Input Loss Landscapes Reveal Residual Memorization in Post-Unlearning LLMs
par: Cohen, Liran, et autres
Publié: (2025)
par: Cohen, Liran, et autres
Publié: (2025)
Refusal in LLMs is an Affine Function
par: Marshall, Thomas, et autres
Publié: (2024)
par: Marshall, Thomas, et autres
Publié: (2024)
Hysteresis Activation Function for Efficient Inference
par: Kimhi, Moshe, et autres
Publié: (2024)
par: Kimhi, Moshe, et autres
Publié: (2024)
Leveraging NTPs for Efficient Hallucination Detection in VLMs
par: Azachi, Ofir, et autres
Publié: (2025)
par: Azachi, Ofir, et autres
Publié: (2025)
Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
par: Kordonsky, Tomer, et autres
Publié: (2026)
par: Kordonsky, Tomer, et autres
Publié: (2026)
The Dark Side of the Language: Pre-trained Transformers in the DarkNet
par: Ranaldi, Leonardo, et autres
Publié: (2022)
par: Ranaldi, Leonardo, et autres
Publié: (2022)
Training a Bilingual Language Model by Mapping Tokens onto a Shared Character Space
par: Rom, Aviad, et autres
Publié: (2024)
par: Rom, Aviad, et autres
Publié: (2024)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
Does Refusal Training in LLMs Generalize to the Past Tense?
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
par: Jain, Neel, et autres
Publié: (2024)
par: Jain, Neel, et autres
Publié: (2024)
Prompt Repetition Improves Non-Reasoning LLMs
par: Leviathan, Yaniv, et autres
Publié: (2025)
par: Leviathan, Yaniv, et autres
Publié: (2025)
Learning a Continue-Thinking Token for Enhanced Test-Time Scaling
par: Ringel, Liran, et autres
Publié: (2025)
par: Ringel, Liran, et autres
Publié: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
Latent Adversarial Training Improves the Representation of Refusal
par: Abbas, Alexandra, et autres
Publié: (2025)
par: Abbas, Alexandra, et autres
Publié: (2025)
TOFU: A Task of Fictitious Unlearning for LLMs
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
par: Zhang, Nonghai, et autres
Publié: (2026)
par: Zhang, Nonghai, et autres
Publié: (2026)
When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation
par: Goren, Shani, et autres
Publié: (2026)
par: Goren, Shani, et autres
Publié: (2026)
How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence
par: Du, Hongzhe, et autres
Publié: (2025)
par: Du, Hongzhe, et autres
Publié: (2025)
A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
par: Chang, Trenton, et autres
Publié: (2025)
par: Chang, Trenton, et autres
Publié: (2025)
Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs
par: Yang, Xikang, et autres
Publié: (2025)
par: Yang, Xikang, et autres
Publié: (2025)
The Dark Side of ChatGPT: Legal and Ethical Challenges from Stochastic Parrots and Hallucination
par: Li, Zihao
Publié: (2023)
par: Li, Zihao
Publié: (2023)
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
par: Mamun, Md Abdullah Al, et autres
Publié: (2025)
par: Mamun, Md Abdullah Al, et autres
Publié: (2025)
Where Do Reasoning Models Refuse?
par: Yamaguchi, Kureha, et autres
Publié: (2025)
par: Yamaguchi, Kureha, et autres
Publié: (2025)
Random Initialization of Gated Sparse Adapters
par: Retault, Vi, et autres
Publié: (2025)
par: Retault, Vi, et autres
Publié: (2025)
The Impossibility of Fair LLMs
par: Anthis, Jacy, et autres
Publié: (2024)
par: Anthis, Jacy, et autres
Publié: (2024)
MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs
par: Liu, Gabrielle Kaili-May, et autres
Publié: (2025)
par: Liu, Gabrielle Kaili-May, et autres
Publié: (2025)
Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails
par: Frank, Gregory N.
Publié: (2026)
par: Frank, Gregory N.
Publié: (2026)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
par: Hu, Xulin, et autres
Publié: (2026)
par: Hu, Xulin, et autres
Publié: (2026)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
Learning to Generate Instruction Tuning Datasets for Zero-Shot Task Adaptation
par: Nayak, Nihal V., et autres
Publié: (2024)
par: Nayak, Nihal V., et autres
Publié: (2024)
Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry
par: Lan, Wenhao, et autres
Publié: (2026)
par: Lan, Wenhao, et autres
Publié: (2026)
Refusal in Language Models Is Mediated by a Single Direction
par: Arditi, Andy, et autres
Publié: (2024)
par: Arditi, Andy, et autres
Publié: (2024)
Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities
par: Dang, Tien, et autres
Publié: (2026)
par: Dang, Tien, et autres
Publié: (2026)
ABCD: All Biases Come Disguised
par: Nowak, Mateusz, et autres
Publié: (2026)
par: Nowak, Mateusz, et autres
Publié: (2026)
Documents similaires
-
Silent Tokens, Loud Effects: Padding in LLMs
par: Himelstein, Rom, et autres
Publié: (2025) -
Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
par: Rahimi, Eliron, et autres
Publié: (2026) -
Jailbreak Attack Initializations as Extractors of Compliance Directions
par: Levi, Amit, et autres
Publié: (2025) -
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
par: LeVi, Amit, et autres
Publié: (2025) -
Representing LLMs in Prompt Semantic Task Space
par: Kashani, Idan, et autres
Publié: (2025)