Single Character Perturbations Break LLM Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Leon, Brown, Hannah, Kawaguchi, Kenji, Shieh, Michael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
Prompt Optimization via Adversarial In-Context Learning
di: Do, Xuan Long, et al.
Pubblicazione: (2023)
di: Do, Xuan Long, et al.
Pubblicazione: (2023)
Investigating Layer Importance in Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
Does Alignment Tuning Really Break LLMs' Internal Confidence?
di: Oh, Hongseok, et al.
Pubblicazione: (2024)
di: Oh, Hongseok, et al.
Pubblicazione: (2024)
Consolidating Rewarded Perturbations for LLM Post-Training
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment
di: Lu, Keming, et al.
Pubblicazione: (2024)
di: Lu, Keming, et al.
Pubblicazione: (2024)
Unintended Impacts of LLM Alignment on Global Representation
di: Ryan, Michael J., et al.
Pubblicazione: (2024)
di: Ryan, Michael J., et al.
Pubblicazione: (2024)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
di: Fu, Yichao, et al.
Pubblicazione: (2024)
di: Fu, Yichao, et al.
Pubblicazione: (2024)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation
di: Miandoab, Kaveh Eskandari, et al.
Pubblicazione: (2025)
di: Miandoab, Kaveh Eskandari, et al.
Pubblicazione: (2025)
A Single Character can Make or Break Your LLM Evals
di: Su, Jingtong, et al.
Pubblicazione: (2025)
di: Su, Jingtong, et al.
Pubblicazione: (2025)
Breaking Symmetry When Training Transformers
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness
di: Deng, Haotian, et al.
Pubblicazione: (2025)
di: Deng, Haotian, et al.
Pubblicazione: (2025)
Advancing LLM Safe Alignment with Safety Representation Ranking
di: Du, Tianqi, et al.
Pubblicazione: (2025)
di: Du, Tianqi, et al.
Pubblicazione: (2025)
Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Improving LLM Safety Alignment with Dual-Objective Optimization
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
PluralLLM: Pluralistic Alignment in LLMs via Federated Learning
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
Breaking the Language Barrier: Can Direct Inference Outperform Pre-Translation in Multilingual LLM Applications?
di: Intrator, Yotam, et al.
Pubblicazione: (2024)
di: Intrator, Yotam, et al.
Pubblicazione: (2024)
Learning Mutually Informed Representations for Characters and Subwords
di: Wang, Yilin, et al.
Pubblicazione: (2023)
di: Wang, Yilin, et al.
Pubblicazione: (2023)
CLaSP: Learning Concepts for Time-Series Signals from Natural Language Supervision
di: Ito, Aoi, et al.
Pubblicazione: (2024)
di: Ito, Aoi, et al.
Pubblicazione: (2024)
The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives
di: Bou, Matthieu, et al.
Pubblicazione: (2025)
di: Bou, Matthieu, et al.
Pubblicazione: (2025)
SALSA: Single-pass Autoregressive LLM Structured Classification
di: Berdichevsky, Ruslan, et al.
Pubblicazione: (2025)
di: Berdichevsky, Ruslan, et al.
Pubblicazione: (2025)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
Breaking the Attention Bottleneck
di: Hilsenbek, Kalle
Pubblicazione: (2024)
di: Hilsenbek, Kalle
Pubblicazione: (2024)
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
di: Chen, Runjin, et al.
Pubblicazione: (2025)
di: Chen, Runjin, et al.
Pubblicazione: (2025)
UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL
di: Patel, Nyal, et al.
Pubblicazione: (2025)
di: Patel, Nyal, et al.
Pubblicazione: (2025)
Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series
di: Hu, Yuxiao, et al.
Pubblicazione: (2025)
di: Hu, Yuxiao, et al.
Pubblicazione: (2025)
SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
di: Roytburg, Dani, et al.
Pubblicazione: (2025)
di: Roytburg, Dani, et al.
Pubblicazione: (2025)
Value Drifts: Tracing Value Alignment During LLM Post-Training
di: Bhatia, Mehar, et al.
Pubblicazione: (2025)
di: Bhatia, Mehar, et al.
Pubblicazione: (2025)
CharED: Character-wise Ensemble Decoding for Large Language Models
di: Gu, Kevin, et al.
Pubblicazione: (2024)
di: Gu, Kevin, et al.
Pubblicazione: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
RLTHF: Targeted Human Feedback for LLM Alignment
di: Xu, Yifei, et al.
Pubblicazione: (2025)
di: Xu, Yifei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024) -
Prompt Optimization via Adversarial In-Context Learning
di: Do, Xuan Long, et al.
Pubblicazione: (2023) -
Investigating Layer Importance in Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2024) -
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023) -
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)