Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
Fuente:
arXiv
Guardado en:
| Autores principales: | Verma, Apurv, Krishna, Satyapriya, Gehrmann, Sebastian, Seshadri, Madhavan, Pradhan, Anu, Ault, Tom, Barrett, Leslie, Rabinowitz, David, Doucette, John, Phan, NhatHai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Watermarking Degrades Alignment in Language Models: Analysis and Mitigation
por: Verma, Apurv, et al.
Publicado: (2025)
por: Verma, Apurv, et al.
Publicado: (2025)
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
por: Pradhan, Anu, et al.
Publicado: (2025)
por: Pradhan, Anu, et al.
Publicado: (2025)
PromSec: Prompt Optimization for Secure Generation of Functional Source Code with Large Language Models (LLMs)
por: Nazzal, Mahmoud, et al.
Publicado: (2024)
por: Nazzal, Mahmoud, et al.
Publicado: (2024)
Gradient Transformer: Learning to Generate Updates for LLMs
por: Nguyen, Binh-Nguyen, et al.
Publicado: (2026)
por: Nguyen, Binh-Nguyen, et al.
Publicado: (2026)
Program Structure-aware Language Models: Targeted Software Testing beyond Textual Semantics
por: Tran, Khang, et al.
Publicado: (2026)
por: Tran, Khang, et al.
Publicado: (2026)
ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks
por: ALBarqawi, Ahmad, et al.
Publicado: (2025)
por: ALBarqawi, Ahmad, et al.
Publicado: (2025)
SoK: Are Watermarks in LLMs Ready for Deployment?
por: Dang, Kieu, et al.
Publicado: (2025)
por: Dang, Kieu, et al.
Publicado: (2025)
Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law
por: Kordjamshidi, Parisa, et al.
Publicado: (2026)
por: Kordjamshidi, Parisa, et al.
Publicado: (2026)
PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
por: Nguyen, Tuan, et al.
Publicado: (2025)
por: Nguyen, Tuan, et al.
Publicado: (2025)
Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection
por: Dang, Kieu, et al.
Publicado: (2026)
por: Dang, Kieu, et al.
Publicado: (2026)
Poison with Style: A Practical Poisoning Attack on Code Large Language Models
por: Tran, Khang, et al.
Publicado: (2026)
por: Tran, Khang, et al.
Publicado: (2026)
FairDP: Certified Fairness with Differential Privacy
por: Tran, Khang, et al.
Publicado: (2023)
por: Tran, Khang, et al.
Publicado: (2023)
$δ$-STEAL: LLM Stealing Attack with Local Differential Privacy
por: Dang, Kieu, et al.
Publicado: (2025)
por: Dang, Kieu, et al.
Publicado: (2025)
SGFusion: Stochastic Geographic Gradient Fusion in Federated Learning
por: Nguyen, Khoa, et al.
Publicado: (2025)
por: Nguyen, Khoa, et al.
Publicado: (2025)
A Client-level Assessment of Collaborative Backdoor Poisoning in Non-IID Federated Learning
por: Lai, Phung, et al.
Publicado: (2025)
por: Lai, Phung, et al.
Publicado: (2025)
NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs
por: Nguyen, Khoa, et al.
Publicado: (2026)
por: Nguyen, Khoa, et al.
Publicado: (2026)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
por: Kroeger, Nicholas, et al.
Publicado: (2023)
por: Kroeger, Nicholas, et al.
Publicado: (2023)
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
por: Liang, Jiacheng, et al.
Publicado: (2026)
por: Liang, Jiacheng, et al.
Publicado: (2026)
Smooth Models for Certain Fibered Partially Hyperbolic Systems
por: Doucette, Meg
Publicado: (2022)
por: Doucette, Meg
Publicado: (2022)
Demo: SGCode: A Flexible Prompt-Optimizing System for Secure Generation of Code
por: Ton, Khiem, et al.
Publicado: (2024)
por: Ton, Khiem, et al.
Publicado: (2024)
SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search
por: Yan, Yu, et al.
Publicado: (2026)
por: Yan, Yu, et al.
Publicado: (2026)
Understanding the Effects of Iterative Prompting on Truthfulness
por: Krishna, Satyapriya, et al.
Publicado: (2024)
por: Krishna, Satyapriya, et al.
Publicado: (2024)
On the Trade-offs between Adversarial Robustness and Actionable Explanations
por: Krishna, Satyapriya, et al.
Publicado: (2023)
por: Krishna, Satyapriya, et al.
Publicado: (2023)
Reward Models are Metrics in a Trench Coat
por: Gehrmann, Sebastian
Publicado: (2025)
por: Gehrmann, Sebastian
Publicado: (2025)
More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness
por: Li, Aaron J., et al.
Publicado: (2024)
por: Li, Aaron J., et al.
Publicado: (2024)
Relative $\mathbb{A}^1$-Contractibility of Smooth Schemes and Exotic Motivic Spheres
por: Vijayalakshmi, Krishna Kumar Madhavan
Publicado: (2026)
por: Vijayalakshmi, Krishna Kumar Madhavan
Publicado: (2026)
Relative $\mathbb{A}^1$-Contractibility of Koras-Russell Prototypes and Exotic Motivic Spheres
por: Vijayalakshmi, Krishna Kumar Madhavan
Publicado: (2025)
por: Vijayalakshmi, Krishna Kumar Madhavan
Publicado: (2025)
Self-Correcting Large Language Models: Generation vs. Multiple Choice
por: Rahmani, Hossein A., et al.
Publicado: (2025)
por: Rahmani, Hossein A., et al.
Publicado: (2025)
Benchmarking LLMs in an Embodied Environment for Blue Team Threat Hunting
por: Liu, Xiaoqun, et al.
Publicado: (2025)
por: Liu, Xiaoqun, et al.
Publicado: (2025)
Theory Of Smoothpath where it connects to various branches
por: Sarangi, Apurv
Publicado: (2025)
por: Sarangi, Apurv
Publicado: (2025)
Differentially Private High Dimensional Bandits
por: Shukla, Apurv
Publicado: (2024)
por: Shukla, Apurv
Publicado: (2024)
Red-Teaming Segment Anything Model
por: Jankowski, Krzysztof, et al.
Publicado: (2024)
por: Jankowski, Krzysztof, et al.
Publicado: (2024)
Red Teaming Large Reasoning Models
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
Red Teaming Visual Language Models
por: Li, Mukai, et al.
Publicado: (2024)
por: Li, Mukai, et al.
Publicado: (2024)
Red Teaming AI Red Teaming
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
Benchmark Early and Red Team Often: A Framework for Assessing and Managing Dual-Use Hazards of AI Foundation Models
por: Barrett, Anthony M., et al.
Publicado: (2024)
por: Barrett, Anthony M., et al.
Publicado: (2024)
RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
por: Mo, Wenjie Jacky, et al.
Publicado: (2025)
por: Mo, Wenjie Jacky, et al.
Publicado: (2025)
Chaos and Dissipation in Hamiltonian and Trojan Regimes: A Comparative Study
por: Doucette, Doug
Publicado: (2026)
por: Doucette, Doug
Publicado: (2026)
Chaotic Persistence and The Paradox of Sticky Chaos
por: Doucette, Doug
Publicado: (2026)
por: Doucette, Doug
Publicado: (2026)
The Postdevelopmental State
por: Doucette, Jamie
Publicado: (2024)
por: Doucette, Jamie
Publicado: (2024)
Ejemplares similares
-
Watermarking Degrades Alignment in Language Models: Analysis and Mitigation
por: Verma, Apurv, et al.
Publicado: (2025) -
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
por: Pradhan, Anu, et al.
Publicado: (2025) -
PromSec: Prompt Optimization for Secure Generation of Functional Source Code with Large Language Models (LLMs)
por: Nazzal, Mahmoud, et al.
Publicado: (2024) -
Gradient Transformer: Learning to Generate Updates for LLMs
por: Nguyen, Binh-Nguyen, et al.
Publicado: (2026) -
Program Structure-aware Language Models: Targeted Software Testing beyond Textual Semantics
por: Tran, Khang, et al.
Publicado: (2026)