Activation Steering for Masked Diffusion Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Shnaidman, Adi, Feiglin, Erin, Yaari, Osher, Mentel, Efrat, Levi, Amit, Lapid, Raz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BenchOverflow: Measuring Overflow in Large Language Models via Plain-Text Prompts
por: Feiglin, Erin, et al.
Publicado: (2026)
por: Feiglin, Erin, et al.
Publicado: (2026)
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
por: Lapid, Raz, et al.
Publicado: (2023)
por: Lapid, Raz, et al.
Publicado: (2023)
On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors
por: Vaisman, Amit, et al.
Publicado: (2026)
por: Vaisman, Amit, et al.
Publicado: (2026)
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
por: LeVi, Amit, et al.
Publicado: (2025)
por: LeVi, Amit, et al.
Publicado: (2025)
Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines
por: Lapid, Raz, et al.
Publicado: (2025)
por: Lapid, Raz, et al.
Publicado: (2025)
SastBench: A Benchmark for Testing Agentic SAST Triage
por: Feiglin, Jake, et al.
Publicado: (2026)
por: Feiglin, Jake, et al.
Publicado: (2026)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
por: Avrahami, Eden, et al.
Publicado: (2026)
por: Avrahami, Eden, et al.
Publicado: (2026)
Contextual Linear Activation Steering of Language Models
por: Hsu, Brandon, et al.
Publicado: (2026)
por: Hsu, Brandon, et al.
Publicado: (2026)
Steering Language Models With Activation Engineering
por: Turner, Alexander Matt, et al.
Publicado: (2023)
por: Turner, Alexander Matt, et al.
Publicado: (2023)
Activation Scaling for Steering and Interpreting Language Models
por: Stoehr, Niklas, et al.
Publicado: (2024)
por: Stoehr, Niklas, et al.
Publicado: (2024)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Controlling Large Language Model Agents with Entropic Activation Steering
por: Rahn, Nate, et al.
Publicado: (2024)
por: Rahn, Nate, et al.
Publicado: (2024)
Cross-Lingual Activation Steering for Multilingual Language Models
por: Pokharel, Rhitabrat, et al.
Publicado: (2026)
por: Pokharel, Rhitabrat, et al.
Publicado: (2026)
TABES: Trajectory-Aware Backward-on-Entropy Steering for Masked Diffusion Models
por: Saini, Shreshth, et al.
Publicado: (2026)
por: Saini, Shreshth, et al.
Publicado: (2026)
Endogenous Resistance to Activation Steering in Language Models
por: McKenzie, Alex, et al.
Publicado: (2026)
por: McKenzie, Alex, et al.
Publicado: (2026)
Salmon: A Suite for Acoustic Language Model Evaluation
por: Maimon, Gallil, et al.
Publicado: (2024)
por: Maimon, Gallil, et al.
Publicado: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
por: Roth, Amit, et al.
Publicado: (2024)
por: Roth, Amit, et al.
Publicado: (2024)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
por: You, Zejia, et al.
Publicado: (2026)
por: You, Zejia, et al.
Publicado: (2026)
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
por: Xie, Jiaqing
Publicado: (2025)
por: Xie, Jiaqing
Publicado: (2025)
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
por: Tang, Xinyu, et al.
Publicado: (2025)
por: Tang, Xinyu, et al.
Publicado: (2025)
REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
por: Zhan, Li-Ming, et al.
Publicado: (2025)
por: Zhan, Li-Ming, et al.
Publicado: (2025)
Programming Refusal with Conditional Activation Steering
por: Lee, Bruce W., et al.
Publicado: (2024)
por: Lee, Bruce W., et al.
Publicado: (2024)
Flashback: A Reversible Bilateral Run-Peeling Decomposition of Strings
por: Konstantinovsky, Thomas, et al.
Publicado: (2026)
por: Konstantinovsky, Thomas, et al.
Publicado: (2026)
Masked Diffusion Language Models with Frequency-Informed Training
por: Kosmopoulou, Despoina, et al.
Publicado: (2025)
por: Kosmopoulou, Despoina, et al.
Publicado: (2025)
Fine-Grained Activation Steering: Steering Less, Achieving More
por: Feng, Zijian, et al.
Publicado: (2026)
por: Feng, Zijian, et al.
Publicado: (2026)
Scaling Analysis of Interleaved Speech-Text Language Models
por: Maimon, Gallil, et al.
Publicado: (2025)
por: Maimon, Gallil, et al.
Publicado: (2025)
Improving Instruction-Following in Language Models through Activation Steering
por: Stolfo, Alessandro, et al.
Publicado: (2024)
por: Stolfo, Alessandro, et al.
Publicado: (2024)
SLAM: Structural Linguistic Activation Marking for Language Models
por: Harel-Canada, Fabrice, et al.
Publicado: (2026)
por: Harel-Canada, Fabrice, et al.
Publicado: (2026)
Scaling Beyond Masked Diffusion Language Models
por: Sahoo, Subham Sekhar, et al.
Publicado: (2026)
por: Sahoo, Subham Sekhar, et al.
Publicado: (2026)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
Steer2Edit: From Activation Steering to Component-Level Editing
por: Sun, Chung-En, et al.
Publicado: (2026)
por: Sun, Chung-En, et al.
Publicado: (2026)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
por: Guang, Jiahui, et al.
Publicado: (2026)
por: Guang, Jiahui, et al.
Publicado: (2026)
Embedding Inversion via Conditional Masked Diffusion Language Models
por: Xiao, Han
Publicado: (2026)
por: Xiao, Han
Publicado: (2026)
Edit-Based Refinement for Parallel Masked Diffusion Language Models
por: Ren, Houxing, et al.
Publicado: (2026)
por: Ren, Houxing, et al.
Publicado: (2026)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
DLM-SWAI: Steering Diffusion Language Models Before They Unmask
por: An, Hyeseon, et al.
Publicado: (2026)
por: An, Hyeseon, et al.
Publicado: (2026)
Steering off Course: Reliability Challenges in Steering Language Models
por: Da Silva, Patrick Queiroz, et al.
Publicado: (2025)
por: Da Silva, Patrick Queiroz, et al.
Publicado: (2025)
Steering Awareness: Detecting Activation Steering from Within
por: Rivera, Joshua Fonseca, et al.
Publicado: (2025)
por: Rivera, Joshua Fonseca, et al.
Publicado: (2025)
Soft-Masked Diffusion Language Models
por: Hersche, Michael, et al.
Publicado: (2025)
por: Hersche, Michael, et al.
Publicado: (2025)
Diffutron: A Masked Diffusion Language Model for Turkish Language
por: Kocabay, Şuayp Talha, et al.
Publicado: (2026)
por: Kocabay, Şuayp Talha, et al.
Publicado: (2026)
Ejemplares similares
-
BenchOverflow: Measuring Overflow in Large Language Models via Plain-Text Prompts
por: Feiglin, Erin, et al.
Publicado: (2026) -
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
por: Lapid, Raz, et al.
Publicado: (2023) -
On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors
por: Vaisman, Amit, et al.
Publicado: (2026) -
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
por: LeVi, Amit, et al.
Publicado: (2025) -
Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines
por: Lapid, Raz, et al.
Publicado: (2025)