Red Teaming Language Models for Processing Contradictory Dialogues
Fuente:
arXiv
Saved in:
| Main Authors: | Wen, Xiaofei, Li, Bangzheng, Huang, Tenghao, Chen, Muhao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Affective and Dynamic Beam Search for Story Generation
by: Huang, Tenghao, et al.
Published: (2023)
by: Huang, Tenghao, et al.
Published: (2023)
Planning and Editing What You Retrieve for Enhanced Tool Learning
by: Huang, Tenghao, et al.
Published: (2024)
by: Huang, Tenghao, et al.
Published: (2024)
Teaching Language Models To Gather Information Proactively
by: Huang, Tenghao, et al.
Published: (2025)
by: Huang, Tenghao, et al.
Published: (2025)
FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation
by: Li, Bangzheng, et al.
Published: (2024)
by: Li, Bangzheng, et al.
Published: (2024)
DiscoSum: Discourse-aware News Summarization
by: Spangher, Alexander, et al.
Published: (2025)
by: Spangher, Alexander, et al.
Published: (2025)
FoodPuzzle: Developing Large Language Model Agents as Flavor Scientists
by: Huang, Tenghao, et al.
Published: (2024)
by: Huang, Tenghao, et al.
Published: (2024)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
by: Cai, Rui, et al.
Published: (2025)
by: Cai, Rui, et al.
Published: (2025)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
by: Li, Bangzheng, et al.
Published: (2023)
by: Li, Bangzheng, et al.
Published: (2023)
Optimizing Diversity and Quality through Base-Aligned Model Collaboration
by: Wang, Yichen, et al.
Published: (2025)
by: Wang, Yichen, et al.
Published: (2025)
Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation
by: Jung, Dongwon, et al.
Published: (2024)
by: Jung, Dongwon, et al.
Published: (2024)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
by: Yan, Siyu, et al.
Published: (2025)
by: Yan, Siyu, et al.
Published: (2025)
Personalized Topic Selection Model for Topic-Grounded Dialogue
by: Fan, Shixuan, et al.
Published: (2024)
by: Fan, Shixuan, et al.
Published: (2024)
Red Teaming Large Language Models for Healthcare
by: Balazadeh, Vahid, et al.
Published: (2025)
by: Balazadeh, Vahid, et al.
Published: (2025)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
by: Huang, Tenghao, et al.
Published: (2026)
by: Huang, Tenghao, et al.
Published: (2026)
Red Teaming Visual Language Models
by: Li, Mukai, et al.
Published: (2024)
by: Li, Mukai, et al.
Published: (2024)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
by: Li, Bangzheng, et al.
Published: (2025)
by: Li, Bangzheng, et al.
Published: (2025)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
by: Guo, Ruohao, et al.
Published: (2025)
by: Guo, Ruohao, et al.
Published: (2025)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
by: Wen, Xiaofei, et al.
Published: (2025)
by: Wen, Xiaofei, et al.
Published: (2025)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
by: Liu, Xiaogeng, et al.
Published: (2023)
by: Liu, Xiaogeng, et al.
Published: (2023)
Injecting Salesperson's Dialogue Strategies in Large Language Models with Chain-of-Thought Reasoning
by: Chang, Wen-Yu, et al.
Published: (2024)
by: Chang, Wen-Yu, et al.
Published: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
by: Xu, Huiyu, et al.
Published: (2024)
by: Xu, Huiyu, et al.
Published: (2024)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
by: Shamsi, Zafir, et al.
Published: (2026)
by: Shamsi, Zafir, et al.
Published: (2026)
Anecdoctoring: Automated Red-Teaming Across Language and Place
by: Cuevas, Alejandro, et al.
Published: (2025)
by: Cuevas, Alejandro, et al.
Published: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
by: Ding, Jiale, et al.
Published: (2025)
by: Ding, Jiale, et al.
Published: (2025)
Exploring Straightforward Conversational Red-Teaming
by: Kour, George, et al.
Published: (2024)
by: Kour, George, et al.
Published: (2024)
The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
by: Furuya, Kotaro, et al.
Published: (2025)
by: Furuya, Kotaro, et al.
Published: (2025)
STAR: SocioTechnical Approach to Red Teaming Language Models
by: Weidinger, Laura, et al.
Published: (2024)
by: Weidinger, Laura, et al.
Published: (2024)
Polarized Patterns of Language Toxicity and Sentiment of Debunking Posts on Social Media
by: Xu, Wentao, et al.
Published: (2025)
by: Xu, Wentao, et al.
Published: (2025)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
by: Zhang, Hongxiang, et al.
Published: (2025)
by: Zhang, Hongxiang, et al.
Published: (2025)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
by: Liu, Jiaxu, et al.
Published: (2024)
by: Liu, Jiaxu, et al.
Published: (2024)
TroubleLLM: Align to Red Team Expert
by: Xu, Zhuoer, et al.
Published: (2024)
by: Xu, Zhuoer, et al.
Published: (2024)
FERRET: Framework for Expansion Reliant Red Teaming
by: Mehrabi, Ninareh, et al.
Published: (2026)
by: Mehrabi, Ninareh, et al.
Published: (2026)
A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
by: Feier, Andrei Marian, et al.
Published: (2026)
by: Feier, Andrei Marian, et al.
Published: (2026)
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
by: Srikanth, Siddharth, et al.
Published: (2026)
by: Srikanth, Siddharth, et al.
Published: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
by: Liu, Yanjiang, et al.
Published: (2025)
by: Liu, Yanjiang, et al.
Published: (2025)
Code Execution as Grounded Supervision for LLM Reasoning
by: Jung, Dongwon, et al.
Published: (2025)
by: Jung, Dongwon, et al.
Published: (2025)
Offset Unlearning for Large Language Models
by: Huang, James Y., et al.
Published: (2024)
by: Huang, James Y., et al.
Published: (2024)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
by: Wu, Donghang, et al.
Published: (2025)
by: Wu, Donghang, et al.
Published: (2025)
Red Teaming for Large Language Models At Scale: Tackling Hallucinations on Mathematics Tasks
by: Buszydlik, Aleksander, et al.
Published: (2023)
by: Buszydlik, Aleksander, et al.
Published: (2023)
RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
by: Mo, Wenjie Jacky, et al.
Published: (2025)
by: Mo, Wenjie Jacky, et al.
Published: (2025)
Similar Items
-
Affective and Dynamic Beam Search for Story Generation
by: Huang, Tenghao, et al.
Published: (2023) -
Planning and Editing What You Retrieve for Enhanced Tool Learning
by: Huang, Tenghao, et al.
Published: (2024) -
Teaching Language Models To Gather Information Proactively
by: Huang, Tenghao, et al.
Published: (2025) -
FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation
by: Li, Bangzheng, et al.
Published: (2024) -
DiscoSum: Discourse-aware News Summarization
by: Spangher, Alexander, et al.
Published: (2025)