Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rahimi, Eliron, Hirshel, Elad, Himelstein, Rom, LeVi, Amit, Mendelson, Avi, Baskin, Chaim |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Silenced Biases: The Dark Side LLMs Learned to Refuse
par: Himelstein, Rom, et autres
Publié: (2025)
par: Himelstein, Rom, et autres
Publié: (2025)
Silent Tokens, Loud Effects: Padding in LLMs
par: Himelstein, Rom, et autres
Publié: (2025)
par: Himelstein, Rom, et autres
Publié: (2025)
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
par: LeVi, Amit, et autres
Publié: (2025)
par: LeVi, Amit, et autres
Publié: (2025)
Jailbreak Attack Initializations as Extractors of Compliance Directions
par: Levi, Amit, et autres
Publié: (2025)
par: Levi, Amit, et autres
Publié: (2025)
Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
par: Kordonsky, Tomer, et autres
Publié: (2026)
par: Kordonsky, Tomer, et autres
Publié: (2026)
Sparse patches adversarial attacks via extrapolating point-wise information
par: Nemcovsky, Yaniv, et autres
Publié: (2024)
par: Nemcovsky, Yaniv, et autres
Publié: (2024)
Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges
par: Kosman, Eitan, et autres
Publié: (2026)
par: Kosman, Eitan, et autres
Publié: (2026)
AMED: Automatic Mixed-Precision Quantization for Edge Devices
par: Kimhi, Moshe, et autres
Publié: (2022)
par: Kimhi, Moshe, et autres
Publié: (2022)
Hysteresis Activation Function for Efficient Inference
par: Kimhi, Moshe, et autres
Publié: (2024)
par: Kimhi, Moshe, et autres
Publié: (2024)
SCART: Simulation of Cyber Attacks for Real-Time
par: Rahimi, Eliron, et autres
Publié: (2023)
par: Rahimi, Eliron, et autres
Publié: (2023)
Domain Restriction via Multi SAE Layer Transitions
par: Shaheen, Elias, et autres
Publié: (2026)
par: Shaheen, Elias, et autres
Publié: (2026)
$\mathbf{R}^3$: Reconstruction, Raw, and Rain: Deraining Directly in the Bayer Domain
par: Rothschild, Nate, et autres
Publié: (2025)
par: Rothschild, Nate, et autres
Publié: (2025)
Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models
par: Arriola, Marianne, et autres
Publié: (2025)
par: Arriola, Marianne, et autres
Publié: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
CARES: Context-Aware Resolution Selector for VLMs
par: Kimhi, Moshe, et autres
Publié: (2025)
par: Kimhi, Moshe, et autres
Publié: (2025)
Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance
par: Wu, Junde, et autres
Publié: (2026)
par: Wu, Junde, et autres
Publié: (2026)
Discriminator Guidance for Autoregressive Diffusion Models
par: Kelvinius, Filip Ekström, et autres
Publié: (2023)
par: Kelvinius, Filip Ekström, et autres
Publié: (2023)
Soft-Masked Diffusion Language Models
par: Hersche, Michael, et autres
Publié: (2025)
par: Hersche, Michael, et autres
Publié: (2025)
Locally Coherent Parallel Decoding in Diffusion Language Models
par: Hersche, Michael, et autres
Publié: (2026)
par: Hersche, Michael, et autres
Publié: (2026)
Refusal in Language Models Is Mediated by a Single Direction
par: Arditi, Andy, et autres
Publié: (2024)
par: Arditi, Andy, et autres
Publié: (2024)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
DEER: Draft with Diffusion, Verify with Autoregressive Models
par: Cheng, Zicong, et autres
Publié: (2025)
par: Cheng, Zicong, et autres
Publié: (2025)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
par: Yang, Puning, et autres
Publié: (2026)
par: Yang, Puning, et autres
Publié: (2026)
SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models
par: Piras, Giorgio, et autres
Publié: (2025)
par: Piras, Giorgio, et autres
Publié: (2025)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
par: Fu, Yonggan, et autres
Publié: (2025)
par: Fu, Yonggan, et autres
Publié: (2025)
Leveraging Temporal Graph Networks Using Module Decoupling
par: Feldman, Or, et autres
Publié: (2023)
par: Feldman, Or, et autres
Publié: (2023)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
par: Hu, Xulin, et autres
Publié: (2026)
par: Hu, Xulin, et autres
Publié: (2026)
Diffusion In Diffusion: Reclaiming Global Coherence in Semi-Autoregressive Diffusion
par: Ma, Linrui, et autres
Publié: (2026)
par: Ma, Linrui, et autres
Publié: (2026)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
par: Wollschläger, Tom, et autres
Publié: (2025)
par: Wollschläger, Tom, et autres
Publié: (2025)
Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning
par: Berrayana, Lina, et autres
Publié: (2026)
par: Berrayana, Lina, et autres
Publié: (2026)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
par: Li, Jia-Nan, et autres
Publié: (2025)
par: Li, Jia-Nan, et autres
Publié: (2025)
Where Do Reasoning Models Refuse?
par: Yamaguchi, Kureha, et autres
Publié: (2025)
par: Yamaguchi, Kureha, et autres
Publié: (2025)
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)
par: Dabas, Mahavir, et autres
Publié: (2025)
Continuous Autoregressive Language Models
par: Shao, Chenze, et autres
Publié: (2025)
par: Shao, Chenze, et autres
Publié: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
par: Ding, Zihan, et autres
Publié: (2024)
par: Ding, Zihan, et autres
Publié: (2024)
Research Program: Theory of Learning in Dynamical Systems
par: Hazan, Elad, et autres
Publié: (2025)
par: Hazan, Elad, et autres
Publié: (2025)
Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models
par: Kong, Injin, et autres
Publié: (2026)
par: Kong, Injin, et autres
Publié: (2026)
Active propulsion noise shaping for multi-rotor aircraft localization
par: Serussi, Gabriele, et autres
Publié: (2024)
par: Serussi, Gabriele, et autres
Publié: (2024)
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
par: Kim, Minseo, et autres
Publié: (2025)
par: Kim, Minseo, et autres
Publié: (2025)
Non-Uniform Parameter-Wise Model Merging
par: Camacho, Albert Manuel Orozco, et autres
Publié: (2024)
par: Camacho, Albert Manuel Orozco, et autres
Publié: (2024)
Documents similaires
-
Silenced Biases: The Dark Side LLMs Learned to Refuse
par: Himelstein, Rom, et autres
Publié: (2025) -
Silent Tokens, Loud Effects: Padding in LLMs
par: Himelstein, Rom, et autres
Publié: (2025) -
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
par: LeVi, Amit, et autres
Publié: (2025) -
Jailbreak Attack Initializations as Extractors of Compliance Directions
par: Levi, Amit, et autres
Publié: (2025) -
Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
par: Kordonsky, Tomer, et autres
Publié: (2026)