Abstractive Red-Teaming of Language Model Character
Fuente:
arXiv
Salvato in:
| Autori principali: | Rahn, Nate, Qi, Allison, Griffin, Avery, Michala, Jonathan, Sleight, Henry, Jones, Erik |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
di: Chen, Runjin, et al.
Pubblicazione: (2025)
di: Chen, Runjin, et al.
Pubblicazione: (2025)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation
di: Canavan, Callum, et al.
Pubblicazione: (2026)
di: Canavan, Callum, et al.
Pubblicazione: (2026)
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
Text-Diffusion Red-Teaming of Large Language Models: Unveiling Harmful Behaviors with Proximity Constraints
di: Nöther, Jonathan, et al.
Pubblicazione: (2025)
di: Nöther, Jonathan, et al.
Pubblicazione: (2025)
Policy Optimization in a Noisy Neighborhood: On Return Landscapes in Continuous Control
di: Rahn, Nate, et al.
Pubblicazione: (2023)
di: Rahn, Nate, et al.
Pubblicazione: (2023)
Red-Teaming for Inducing Societal Bias in Large Language Models
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs
di: Shilov, Igor, et al.
Pubblicazione: (2025)
di: Shilov, Igor, et al.
Pubblicazione: (2025)
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
di: Li, Chunxiao, et al.
Pubblicazione: (2026)
di: Li, Chunxiao, et al.
Pubblicazione: (2026)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025)
di: Ding, Jiale, et al.
Pubblicazione: (2025)
Automated Red Teaming with GOAT: the Generative Offensive Agent Tester
di: Pavlova, Maya, et al.
Pubblicazione: (2024)
di: Pavlova, Maya, et al.
Pubblicazione: (2024)
Automatic LLM Red Teaming
di: Belaire, Roman, et al.
Pubblicazione: (2025)
di: Belaire, Roman, et al.
Pubblicazione: (2025)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
di: Kaunismaa, Jackson, et al.
Pubblicazione: (2026)
di: Kaunismaa, Jackson, et al.
Pubblicazione: (2026)
Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks
di: Youstra, Jack, et al.
Pubblicazione: (2025)
di: Youstra, Jack, et al.
Pubblicazione: (2025)
Red-Teaming Segment Anything Model
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
Embodied Red Teaming for Auditing Robotic Foundation Models
di: Karnik, Sathwik, et al.
Pubblicazione: (2024)
di: Karnik, Sathwik, et al.
Pubblicazione: (2024)
LOCOST: State-Space Models for Long Document Abstractive Summarization
di: Bronnec, Florian Le, et al.
Pubblicazione: (2024)
di: Bronnec, Florian Le, et al.
Pubblicazione: (2024)
Stabilising Explainability Fragility in Cybersecurity AI: The Impact and Mitigation of Multicollinearity in Public Benchmark Datasets
di: Vourganas, Ioannis J., et al.
Pubblicazione: (2026)
di: Vourganas, Ioannis J., et al.
Pubblicazione: (2026)
Large Language Models Are Zero-Shot Time Series Forecasters
di: Gruver, Nate, et al.
Pubblicazione: (2023)
di: Gruver, Nate, et al.
Pubblicazione: (2023)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
LLM-Assisted Red Teaming of Diffusion Models through "Failures Are Fated, But Can Be Faded"
di: Sagar, Som, et al.
Pubblicazione: (2024)
di: Sagar, Som, et al.
Pubblicazione: (2024)
Geometric Red-Teaming for Robotic Manipulation
di: Goel, Divyam, et al.
Pubblicazione: (2025)
di: Goel, Divyam, et al.
Pubblicazione: (2025)
RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming
di: Zheng, Xiang, et al.
Pubblicazione: (2025)
di: Zheng, Xiang, et al.
Pubblicazione: (2025)
Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers
di: Kezins, Nikita, et al.
Pubblicazione: (2026)
di: Kezins, Nikita, et al.
Pubblicazione: (2026)
BRIDO: Bringing Democratic Order to Abstractive Summarization
di: Lee, Junhyun, et al.
Pubblicazione: (2025)
di: Lee, Junhyun, et al.
Pubblicazione: (2025)
Recursive Abstractive Processing for Retrieval in Dynamic Datasets
di: Chucri, Charbel, et al.
Pubblicazione: (2024)
di: Chucri, Charbel, et al.
Pubblicazione: (2024)
Best-of-N Jailbreaking
di: Hughes, John, et al.
Pubblicazione: (2024)
di: Hughes, John, et al.
Pubblicazione: (2024)
From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
Beyond Win Rates: A Clustering-Based Approach to Character Balance Analysis in Team-Based Games
di: Zhou, Haokun
Pubblicazione: (2025)
di: Zhou, Haokun
Pubblicazione: (2025)
From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL
di: Admoni, Sahar, et al.
Pubblicazione: (2025)
di: Admoni, Sahar, et al.
Pubblicazione: (2025)
RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval
di: Sarthi, Parth, et al.
Pubblicazione: (2024)
di: Sarthi, Parth, et al.
Pubblicazione: (2024)
ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
di: Chen, Zhaorun, et al.
Pubblicazione: (2025)
di: Chen, Zhaorun, et al.
Pubblicazione: (2025)
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
di: Tedeschi, Simone, et al.
Pubblicazione: (2024)
di: Tedeschi, Simone, et al.
Pubblicazione: (2024)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models
di: Wang, Ren-Jian, et al.
Pubblicazione: (2025)
di: Wang, Ren-Jian, et al.
Pubblicazione: (2025)
Cmprsr: Abstractive Token-Level Question-Agnostic Prompt Compressor
di: Zakazov, Ivan, et al.
Pubblicazione: (2025)
di: Zakazov, Ivan, et al.
Pubblicazione: (2025)
Mass-Producing Failures of Multimodal Systems with Language Models
di: Tong, Shengbang, et al.
Pubblicazione: (2023)
di: Tong, Shengbang, et al.
Pubblicazione: (2023)
Entity-level Factual Adaptiveness of Fine-tuning based Abstractive Summarization Models
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
di: Chen, Runjin, et al.
Pubblicazione: (2025) -
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025) -
Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation
di: Canavan, Callum, et al.
Pubblicazione: (2026) -
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
di: Ensign, Danielle, et al.
Pubblicazione: (2025) -
Text-Diffusion Red-Teaming of Large Language Models: Unveiling Harmful Behaviors with Proximity Constraints
di: Nöther, Jonathan, et al.
Pubblicazione: (2025)