RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Asad, Ali, Obadinma, Stephen, Shayanfar, Radin, Zhu, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks
par: Obadinma, Stephen, et autres
Publié: (2025)
par: Obadinma, Stephen, et autres
Publié: (2025)
CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
par: Shayanfar, Radin, et autres
Publié: (2025)
par: Shayanfar, Radin, et autres
Publié: (2025)
Misinformation with Legal Consequences (MisLC): A New Task Towards Harnessing Societal Harm of Misinformation
par: Luo, Chu Fei, et autres
Publié: (2024)
par: Luo, Chu Fei, et autres
Publié: (2024)
Multi-Agent Debate with Memory Masking
par: Tian, Hongduan, et autres
Publié: (2026)
par: Tian, Hongduan, et autres
Publié: (2026)
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
par: Liu, Chenxi, et autres
Publié: (2026)
par: Liu, Chenxi, et autres
Publié: (2026)
Red-Teaming for Inducing Societal Bias in Large Language Models
par: Luo, Chu Fei, et autres
Publié: (2024)
par: Luo, Chu Fei, et autres
Publié: (2024)
GroupDebate: Enhancing the Efficiency of Multi-Agent Debate Using Group Discussion
par: Liu, Tongxuan, et autres
Publié: (2024)
par: Liu, Tongxuan, et autres
Publié: (2024)
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating
par: Wang, Fuyu, et autres
Publié: (2025)
par: Wang, Fuyu, et autres
Publié: (2025)
Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate
par: Wang, Cunda, et autres
Publié: (2026)
par: Wang, Cunda, et autres
Publié: (2026)
Multi-lingual Multi-turn Automated Red Teaming for LLMs
par: Singhania, Abhishek, et autres
Publié: (2025)
par: Singhania, Abhishek, et autres
Publié: (2025)
Improving Multi-Agent Debate with Sparse Communication Topology
par: Li, Yunxuan, et autres
Publié: (2024)
par: Li, Yunxuan, et autres
Publié: (2024)
Combating Adversarial Attacks with Multi-Agent Debate
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
Dynamic Role Assignment for Multi-Agent Debate
par: Zhang, Miao, et autres
Publié: (2026)
par: Zhang, Miao, et autres
Publié: (2026)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
par: Jung, MinJae, et autres
Publié: (2026)
par: Jung, MinJae, et autres
Publié: (2026)
Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents
par: He, Haorui, et autres
Publié: (2025)
par: He, Haorui, et autres
Publié: (2025)
Peacemaker or Troublemaker: How Sycophancy Shapes Multi-Agent Debate
par: Yao, Binwei, et autres
Publié: (2025)
par: Yao, Binwei, et autres
Publié: (2025)
FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
par: Cai, Tianshi, et autres
Publié: (2025)
par: Cai, Tianshi, et autres
Publié: (2025)
HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate
par: Zhu, Shenzhe
Publié: (2025)
par: Zhu, Shenzhe
Publié: (2025)
Effective Red-Teaming of Policy-Adherent Agents
par: Nakash, Itay, et autres
Publié: (2025)
par: Nakash, Itay, et autres
Publié: (2025)
Automated Progressive Red Teaming
par: Jiang, Bojian, et autres
Publié: (2024)
par: Jiang, Bojian, et autres
Publié: (2024)
Learning to Break: Knowledge-Enhanced Reasoning in Multi-Agent Debate System
par: Wang, Haotian, et autres
Publié: (2023)
par: Wang, Haotian, et autres
Publié: (2023)
The Hunger Game Debate: On the Emergence of Over-Competition in Multi-Agent Systems
par: Ma, Xinbei, et autres
Publié: (2025)
par: Ma, Xinbei, et autres
Publié: (2025)
Enhancing Multi-Agent Debate System Performance via Confidence Expression
par: Lin, Zijie, et autres
Publié: (2025)
par: Lin, Zijie, et autres
Publié: (2025)
BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection
par: You, Saukun Thika, et autres
Publié: (2026)
par: You, Saukun Thika, et autres
Publié: (2026)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
par: Dang, Quy-Anh, et autres
Publié: (2026)
par: Dang, Quy-Anh, et autres
Publié: (2026)
Gradient-Based Language Model Red Teaming
par: Wichers, Nevan, et autres
Publié: (2024)
par: Wichers, Nevan, et autres
Publié: (2024)
Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction
par: Huang, Wei-Chieh, et autres
Publié: (2025)
par: Huang, Wei-Chieh, et autres
Publié: (2025)
Debate-Driven Multi-Agent LLMs for Phishing Email Detection
par: Nguyen, Ngoc Tuong Vy, et autres
Publié: (2025)
par: Nguyen, Ngoc Tuong Vy, et autres
Publié: (2025)
DebateQA: Evaluating Question Answering on Debatable Knowledge
par: Xu, Rongwu, et autres
Publié: (2024)
par: Xu, Rongwu, et autres
Publié: (2024)
Can LLMs Beat Humans in Debating? A Dynamic Multi-agent Framework for Competitive Debate
par: Zhang, Yiqun, et autres
Publié: (2024)
par: Zhang, Yiqun, et autres
Publié: (2024)
Exploring Straightforward Conversational Red-Teaming
par: Kour, George, et autres
Publié: (2024)
par: Kour, George, et autres
Publié: (2024)
Voting or Consensus? Decision-Making in Multi-Agent Debate
par: Kaesberg, Lars Benedikt, et autres
Publié: (2025)
par: Kaesberg, Lars Benedikt, et autres
Publié: (2025)
Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
par: Mao, Yanxu, et autres
Publié: (2026)
par: Mao, Yanxu, et autres
Publié: (2026)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation
par: Koupaee, Mahnaz, et autres
Publié: (2025)
par: Koupaee, Mahnaz, et autres
Publié: (2025)
Debating the Unspoken: Role-Anchored Multi-Agent Reasoning for Half-Truth Detection
par: Tang, Yixuan, et autres
Publié: (2026)
par: Tang, Yixuan, et autres
Publié: (2026)
Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
par: Liang, Tian, et autres
Publié: (2023)
par: Liang, Tian, et autres
Publié: (2023)
Documents similaires
-
On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks
par: Obadinma, Stephen, et autres
Publié: (2025) -
CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
par: Shayanfar, Radin, et autres
Publié: (2025) -
Misinformation with Legal Consequences (MisLC): A New Task Towards Harnessing Societal Harm of Misinformation
par: Luo, Chu Fei, et autres
Publié: (2024) -
Multi-Agent Debate with Memory Masking
par: Tian, Hongduan, et autres
Publié: (2026) -
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
par: Liu, Chenxi, et autres
Publié: (2026)