Representation Bending for Large Language Model Safety
Fuente:
arXiv
Guardado en:
| Autores principales: | Yousefpour, Ashkan, Kim, Taeheon, Kwon, Ryan S., Lee, Seungbeen, Jeung, Wonje, Han, Seungju, Wan, Alvin, Ngan, Harrison, Yu, Youngjae, Choi, Jonghyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Language Models Still Exhibit Bias in Long Text
por: Jeung, Wonje, et al.
Publicado: (2024)
por: Jeung, Wonje, et al.
Publicado: (2024)
Adversarial Sample-Based Approach for Tighter Privacy Auditing in Final Model-Only Scenarios
por: Yoon, Sangyeon, et al.
Publicado: (2024)
por: Yoon, Sangyeon, et al.
Publicado: (2024)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
por: Yoon, Sangyeon, et al.
Publicado: (2026)
por: Yoon, Sangyeon, et al.
Publicado: (2026)
sudo rm -rf agentic_security
por: Lee, Sejin, et al.
Publicado: (2025)
por: Lee, Sejin, et al.
Publicado: (2025)
An Information Theoretic Evaluation Metric For Strong Unlearning
por: Jeon, Dongjae, et al.
Publicado: (2024)
por: Jeon, Dongjae, et al.
Publicado: (2024)
System-aware contextual digital twin for ICS anomaly diagnosis
por: Woo, Eungyu, et al.
Publicado: (2026)
por: Woo, Eungyu, et al.
Publicado: (2026)
Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning
por: Kim, Taeheon, et al.
Publicado: (2025)
por: Kim, Taeheon, et al.
Publicado: (2025)
DataFreeShield: Defending Adversarial Attacks without Training Data
por: Lee, Hyeyoon, et al.
Publicado: (2024)
por: Lee, Hyeyoon, et al.
Publicado: (2024)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
por: Akiri, Charankumar, et al.
Publicado: (2025)
por: Akiri, Charankumar, et al.
Publicado: (2025)
Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
por: Jiang, Laura, et al.
Publicado: (2026)
por: Jiang, Laura, et al.
Publicado: (2026)
GraphAttack: Exploiting Representational Blindspots in LLM Safety Mechanisms
por: He, Sinan, et al.
Publicado: (2025)
por: He, Sinan, et al.
Publicado: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
Fastrack: Fast IO for Secure ML using GPU TEEs
por: Wang, Yongqin, et al.
Publicado: (2024)
por: Wang, Yongqin, et al.
Publicado: (2024)
KDPrint: Passive Authentication using Keystroke Dynamics-to-Image Encoding via Standardization
por: Kim, Yooshin, et al.
Publicado: (2024)
por: Kim, Yooshin, et al.
Publicado: (2024)
SEAL: Entangled White-box Watermarks on Low-Rank Adaptation
por: Oh, Giyeong, et al.
Publicado: (2025)
por: Oh, Giyeong, et al.
Publicado: (2025)
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Unified Steganography via Implicit Neural Representation
por: Song, Qi, et al.
Publicado: (2025)
por: Song, Qi, et al.
Publicado: (2025)
PeAR: A Static Binary Rewriting Framework for Binary-Only Fuzzing
por: Charles, Alvin, et al.
Publicado: (2026)
por: Charles, Alvin, et al.
Publicado: (2026)
UniHENN: Designing Faster and More Versatile Homomorphic Encryption-based CNNs without im2col
por: Choi, Hyunmin, et al.
Publicado: (2024)
por: Choi, Hyunmin, et al.
Publicado: (2024)
Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training
por: Lee, Jonghyun, et al.
Publicado: (2025)
por: Lee, Jonghyun, et al.
Publicado: (2025)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
por: Qi, Weiwei, et al.
Publicado: (2026)
por: Qi, Weiwei, et al.
Publicado: (2026)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
por: Shen, Guobin, et al.
Publicado: (2024)
por: Shen, Guobin, et al.
Publicado: (2024)
QUICstep: Evaluating connection migration based QUIC censorship circumvention
por: Lee, Seungju, et al.
Publicado: (2023)
por: Lee, Seungju, et al.
Publicado: (2023)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
UAVCAN Dataset Description
por: Kim, Dongsung, et al.
Publicado: (2022)
por: Kim, Dongsung, et al.
Publicado: (2022)
Optimal partition selection with Rényi differential privacy
por: Harrison, Charlie, et al.
Publicado: (2026)
por: Harrison, Charlie, et al.
Publicado: (2026)
KUDA: Knowledge Unlearning by Deviating Representation for Large Language Models
por: Fang, Ce, et al.
Publicado: (2026)
por: Fang, Ce, et al.
Publicado: (2026)
CuFuzz: Hardening CUDA Programs through Transformation and Fuzzing
por: Singh, Saurabh, et al.
Publicado: (2026)
por: Singh, Saurabh, et al.
Publicado: (2026)
Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models
por: Luo, Weidi, et al.
Publicado: (2026)
por: Luo, Weidi, et al.
Publicado: (2026)
Beyond Fixed and Dynamic Prompts: Embedded Jailbreak Templates for Advancing LLM Security
por: Kim, Hajun, et al.
Publicado: (2025)
por: Kim, Hajun, et al.
Publicado: (2025)
Blind-Touch: Homomorphic Encryption-Based Distributed Neural Network Inference for Privacy-Preserving Fingerprint Authentication
por: Choi, Hyunmin, et al.
Publicado: (2023)
por: Choi, Hyunmin, et al.
Publicado: (2023)
Overthinking Loops in Agents: A Structural Risk via MCP Tools
por: Lee, Yohan, et al.
Publicado: (2026)
por: Lee, Yohan, et al.
Publicado: (2026)
Permit: Permission-Aware Representation Intervention for Controlled Generation in Large Language Models
por: Sun, Pengcheng, et al.
Publicado: (2026)
por: Sun, Pengcheng, et al.
Publicado: (2026)
Verifiable Exponential Mechanism for Median Estimation
por: Kwon, Hyukjun, et al.
Publicado: (2025)
por: Kwon, Hyukjun, et al.
Publicado: (2025)
Enforcing MAVLink Safety & Security Properties Via Refined Multiparty Session Types
por: Amorim, Arthur, et al.
Publicado: (2025)
por: Amorim, Arthur, et al.
Publicado: (2025)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
SoK: A Security Architect's View of Printed Circuit Board Attacks
por: Harrison, Jacob, et al.
Publicado: (2024)
por: Harrison, Jacob, et al.
Publicado: (2024)
Sublinear Risk-Limiting Audits from Direct Ballot Selection and Statistical Ballot Manifests
por: Fuller, Benjamin, et al.
Publicado: (2026)
por: Fuller, Benjamin, et al.
Publicado: (2026)
Secure Coding with AI -- From Detection to Repair
por: Belozerov, Vladislav, et al.
Publicado: (2025)
por: Belozerov, Vladislav, et al.
Publicado: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
por: Lee, JoonHo, et al.
Publicado: (2025)
por: Lee, JoonHo, et al.
Publicado: (2025)
Ejemplares similares
-
Large Language Models Still Exhibit Bias in Long Text
por: Jeung, Wonje, et al.
Publicado: (2024) -
Adversarial Sample-Based Approach for Tighter Privacy Auditing in Final Model-Only Scenarios
por: Yoon, Sangyeon, et al.
Publicado: (2024) -
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
por: Yoon, Sangyeon, et al.
Publicado: (2026) -
sudo rm -rf agentic_security
por: Lee, Sejin, et al.
Publicado: (2025) -
An Information Theoretic Evaluation Metric For Strong Unlearning
por: Jeon, Dongjae, et al.
Publicado: (2024)