Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Si, Yu, Xiao, Mehrabi, Ninareh, Gupta, Rahul, Yu, Zhou, Jia, Ruoxi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Kaleidoscopic Teaming in Multi Agent Simulations
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2025)
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2025)
FERRET: Framework for Expansion Reliant Red Teaming
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2026)
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2026)
FLIRT: Feedback Loop In-context Red Teaming
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2023)
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2023)
RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
von: Mo, Wenjie Jacky, et al.
Veröffentlicht: (2025)
von: Mo, Wenjie Jacky, et al.
Veröffentlicht: (2025)
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
von: Li, Huihan, et al.
Veröffentlicht: (2025)
von: Li, Huihan, et al.
Veröffentlicht: (2025)
Co-Evolving Agents: Learning from Failures as Hard Negatives
von: Jung, Yeonsung, et al.
Veröffentlicht: (2025)
von: Jung, Yeonsung, et al.
Veröffentlicht: (2025)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
K-Edit: Language Model Editing with Contextual Knowledge Awareness
von: Markowitz, Elan, et al.
Veröffentlicht: (2025)
von: Markowitz, Elan, et al.
Veröffentlicht: (2025)
Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions
von: Wang, Shouqiao, et al.
Veröffentlicht: (2026)
von: Wang, Shouqiao, et al.
Veröffentlicht: (2026)
Tree-of-Traversals: A Zero-Shot Reasoning Algorithm for Augmenting Black-box Language Models with Knowledge Graphs
von: Markowitz, Elan, et al.
Veröffentlicht: (2024)
von: Markowitz, Elan, et al.
Veröffentlicht: (2024)
Red Teaming AI Red Teaming
von: Majumdar, Subhabrata, et al.
Veröffentlicht: (2025)
von: Majumdar, Subhabrata, et al.
Veröffentlicht: (2025)
Red-Team Multi-Agent Reinforcement Learning for Emergency Braking Scenario
von: Chen, Yinsong, et al.
Veröffentlicht: (2025)
von: Chen, Yinsong, et al.
Veröffentlicht: (2025)
FASTTRACK: Fast and Accurate Fact Tracing for LLMs
von: Chen, Si, et al.
Veröffentlicht: (2024)
von: Chen, Si, et al.
Veröffentlicht: (2024)
Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models
von: Liu, Yixin, et al.
Veröffentlicht: (2024)
von: Liu, Yixin, et al.
Veröffentlicht: (2024)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
von: Kumarage, Tharindu, et al.
Veröffentlicht: (2025)
von: Kumarage, Tharindu, et al.
Veröffentlicht: (2025)
STARK: Strategic Team of Agents for Refining Kernels
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
Embodied Red Teaming for Auditing Robotic Foundation Models
von: Karnik, Sathwik, et al.
Veröffentlicht: (2024)
von: Karnik, Sathwik, et al.
Veröffentlicht: (2024)
Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies
von: Ovalle, Anaelia, et al.
Veröffentlicht: (2023)
von: Ovalle, Anaelia, et al.
Veröffentlicht: (2023)
Asking Back: Interaction-Layer Antidistillation Watermarks
von: Yang, Guang, et al.
Veröffentlicht: (2026)
von: Yang, Guang, et al.
Veröffentlicht: (2026)
Red Teaming Large Reasoning Models
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
Graph Based Deep Reinforcement Learning Aided by Transformers for Multi-Agent Cooperation
von: Elrod, Michael, et al.
Veröffentlicht: (2025)
von: Elrod, Michael, et al.
Veröffentlicht: (2025)
DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
von: Parekh, Tanmay, et al.
Veröffentlicht: (2025)
von: Parekh, Tanmay, et al.
Veröffentlicht: (2025)
Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection
von: Debi, Tanusree, et al.
Veröffentlicht: (2026)
von: Debi, Tanusree, et al.
Veröffentlicht: (2026)
Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems
von: Zhou, Zhaojiacheng
Veröffentlicht: (2026)
von: Zhou, Zhaojiacheng
Veröffentlicht: (2026)
Dynamic Knowledge Exchange and Dual-diversity Review: Concisely Unleashing the Potential of a Multi-Agent Research Team
von: Yu, Weilun, et al.
Veröffentlicht: (2025)
von: Yu, Weilun, et al.
Veröffentlicht: (2025)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
von: Yan, Siyu, et al.
Veröffentlicht: (2025)
von: Yan, Siyu, et al.
Veröffentlicht: (2025)
Mind the Gap: Comparing Model- vs Agentic-Level Red Teaming with Action-Graph Observability on GPT-OSS-20B
von: Wicaksono, Ilham, et al.
Veröffentlicht: (2025)
von: Wicaksono, Ilham, et al.
Veröffentlicht: (2025)
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
von: Zhou, Andy, et al.
Veröffentlicht: (2025)
von: Zhou, Andy, et al.
Veröffentlicht: (2025)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
von: Yuan, Huining, et al.
Veröffentlicht: (2025)
von: Yuan, Huining, et al.
Veröffentlicht: (2025)
A Safe Harbor for AI Evaluation and Red Teaming
von: Longpre, Shayne, et al.
Veröffentlicht: (2024)
von: Longpre, Shayne, et al.
Veröffentlicht: (2024)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
von: Xu, Zelai, et al.
Veröffentlicht: (2025)
von: Xu, Zelai, et al.
Veröffentlicht: (2025)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
von: Yu, Jiahao, et al.
Veröffentlicht: (2023)
von: Yu, Jiahao, et al.
Veröffentlicht: (2023)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
von: Xu, Huiyu, et al.
Veröffentlicht: (2024)
von: Xu, Huiyu, et al.
Veröffentlicht: (2024)
MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling
von: Wang, Qian, et al.
Veröffentlicht: (2025)
von: Wang, Qian, et al.
Veröffentlicht: (2025)
General Modular Harness for LLM Agents in Multi-Turn Gaming Environments
von: Zhang, Yuxuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuxuan, et al.
Veröffentlicht: (2025)
DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents
von: Chen, Zhaorun, et al.
Veröffentlicht: (2026)
von: Chen, Zhaorun, et al.
Veröffentlicht: (2026)
Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization
von: Yu, Jiahao, et al.
Veröffentlicht: (2025)
von: Yu, Jiahao, et al.
Veröffentlicht: (2025)
Detecting Scarce and Sparse Anomalous: Solving Dual Imbalance in Multi-Instance Learning
von: Jia, Lin-Han, et al.
Veröffentlicht: (2025)
von: Jia, Lin-Han, et al.
Veröffentlicht: (2025)
Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent
von: Wang, Issue Yishu, et al.
Veröffentlicht: (2025)
von: Wang, Issue Yishu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Kaleidoscopic Teaming in Multi Agent Simulations
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2025) -
FERRET: Framework for Expansion Reliant Red Teaming
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2026) -
FLIRT: Feedback Loop In-context Red Teaming
von: Mehrabi, Ninareh, et al.
Veröffentlicht: (2023) -
RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
von: Mo, Wenjie Jacky, et al.
Veröffentlicht: (2025) -
Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time
von: Li, Huihan, et al.
Veröffentlicht: (2025)