FERRET: Framework for Expansion Reliant Red Teaming
Fuente:
arXiv
Guardado en:
| Autores principales: | Mehrabi, Ninareh, Albiero, Vitor, Pavlova, Maya, Bitton, Joanna |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Automated Red Teaming with GOAT: the Generative Offensive Agent Tester
por: Pavlova, Maya, et al.
Publicado: (2024)
por: Pavlova, Maya, et al.
Publicado: (2024)
DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
por: Parekh, Tanmay, et al.
Publicado: (2025)
por: Parekh, Tanmay, et al.
Publicado: (2025)
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
por: Li, Huihan, et al.
Publicado: (2025)
por: Li, Huihan, et al.
Publicado: (2025)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning
por: Chen, Si, et al.
Publicado: (2025)
por: Chen, Si, et al.
Publicado: (2025)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
por: Kumarage, Tharindu, et al.
Publicado: (2025)
por: Kumarage, Tharindu, et al.
Publicado: (2025)
Exploring Straightforward Conversational Red-Teaming
por: Kour, George, et al.
Publicado: (2024)
por: Kour, George, et al.
Publicado: (2024)
FLIRT: Feedback Loop In-context Red Teaming
por: Mehrabi, Ninareh, et al.
Publicado: (2023)
por: Mehrabi, Ninareh, et al.
Publicado: (2023)
TroubleLLM: Align to Red Team Expert
por: Xu, Zhuoer, et al.
Publicado: (2024)
por: Xu, Zhuoer, et al.
Publicado: (2024)
Red Teaming Large Language Models for Healthcare
por: Balazadeh, Vahid, et al.
Publicado: (2025)
por: Balazadeh, Vahid, et al.
Publicado: (2025)
Kaleidoscopic Teaming in Multi Agent Simulations
por: Mehrabi, Ninareh, et al.
Publicado: (2025)
por: Mehrabi, Ninareh, et al.
Publicado: (2025)
Red Teaming Language Models for Processing Contradictory Dialogues
por: Wen, Xiaofei, et al.
Publicado: (2024)
por: Wen, Xiaofei, et al.
Publicado: (2024)
A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
por: Feier, Andrei Marian, et al.
Publicado: (2026)
por: Feier, Andrei Marian, et al.
Publicado: (2026)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
por: Yan, Siyu, et al.
Publicado: (2025)
por: Yan, Siyu, et al.
Publicado: (2025)
Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies
por: Ovalle, Anaelia, et al.
Publicado: (2023)
por: Ovalle, Anaelia, et al.
Publicado: (2023)
Anecdoctoring: Automated Red-Teaming Across Language and Place
por: Cuevas, Alejandro, et al.
Publicado: (2025)
por: Cuevas, Alejandro, et al.
Publicado: (2025)
Recent advancements in LLM Red-Teaming: Techniques, Defenses, and Ethical Considerations
por: Raheja, Tarun, et al.
Publicado: (2024)
por: Raheja, Tarun, et al.
Publicado: (2024)
Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding
por: Yoo, Haneul, et al.
Publicado: (2024)
por: Yoo, Haneul, et al.
Publicado: (2024)
Red Teaming Visual Language Models
por: Li, Mukai, et al.
Publicado: (2024)
por: Li, Mukai, et al.
Publicado: (2024)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
por: Ha, Junwoo, et al.
Publicado: (2025)
por: Ha, Junwoo, et al.
Publicado: (2025)
PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System
por: Munoz, Gary D. Lopez, et al.
Publicado: (2024)
por: Munoz, Gary D. Lopez, et al.
Publicado: (2024)
CulturalTeaming: AI-Assisted Interactive Red-Teaming for Challenging LLMs' (Lack of) Multicultural Knowledge
por: Chiu, Yu Ying, et al.
Publicado: (2024)
por: Chiu, Yu Ying, et al.
Publicado: (2024)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
por: Shamsi, Zafir, et al.
Publicado: (2026)
por: Shamsi, Zafir, et al.
Publicado: (2026)
ParallelPARC: A Scalable Pipeline for Generating Natural-Language Analogies
por: Sultan, Oren, et al.
Publicado: (2024)
por: Sultan, Oren, et al.
Publicado: (2024)
SWAN: Semantic Watermarking with Abstract Meaning Representation
por: Ye, Ziping, et al.
Publicado: (2026)
por: Ye, Ziping, et al.
Publicado: (2026)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
por: Liu, Jiaxu, et al.
Publicado: (2024)
por: Liu, Jiaxu, et al.
Publicado: (2024)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
por: Ding, Jiale, et al.
Publicado: (2025)
por: Ding, Jiale, et al.
Publicado: (2025)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
por: Wang, Xiangyu, et al.
Publicado: (2026)
por: Wang, Xiangyu, et al.
Publicado: (2026)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
por: Xu, Huiyu, et al.
Publicado: (2024)
por: Xu, Huiyu, et al.
Publicado: (2024)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
por: Lee, Hyomin, et al.
Publicado: (2026)
por: Lee, Hyomin, et al.
Publicado: (2026)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
por: Guo, Ruohao, et al.
Publicado: (2025)
por: Guo, Ruohao, et al.
Publicado: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
por: Dong, Jianshuo, et al.
Publicado: (2025)
por: Dong, Jianshuo, et al.
Publicado: (2025)
Effective Red-Teaming of Policy-Adherent Agents
por: Nakash, Itay, et al.
Publicado: (2025)
por: Nakash, Itay, et al.
Publicado: (2025)
STAR: SocioTechnical Approach to Red Teaming Language Models
por: Weidinger, Laura, et al.
Publicado: (2024)
por: Weidinger, Laura, et al.
Publicado: (2024)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
por: Mazeika, Mantas, et al.
Publicado: (2024)
por: Mazeika, Mantas, et al.
Publicado: (2024)
MOSAIC: Masked Objective with Selective Adaptation for In-domain Contrastive Learning
por: Pavlova, Vera, et al.
Publicado: (2025)
por: Pavlova, Vera, et al.
Publicado: (2025)
Robust Persona-Aware Toxicity Detection with Prompt Optimization and Learned Ensembling
por: Atil, Berk, et al.
Publicado: (2026)
por: Atil, Berk, et al.
Publicado: (2026)
SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming
por: Kumar, Anurakt, et al.
Publicado: (2024)
por: Kumar, Anurakt, et al.
Publicado: (2024)
Adaptive Instruction Composition for Automated LLM Red-Teaming
por: Zymet, Jesse, et al.
Publicado: (2026)
por: Zymet, Jesse, et al.
Publicado: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
por: Liu, Yanjiang, et al.
Publicado: (2025)
por: Liu, Yanjiang, et al.
Publicado: (2025)
Ejemplares similares
-
Automated Red Teaming with GOAT: the Generative Offensive Agent Tester
por: Pavlova, Maya, et al.
Publicado: (2024) -
DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
por: Parekh, Tanmay, et al.
Publicado: (2025) -
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
por: Li, Huihan, et al.
Publicado: (2025) -
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
por: Wang, Fei, et al.
Publicado: (2024) -
Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning
por: Chen, Si, et al.
Publicado: (2025)