FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)
Fuente:
arXiv
Salvato in:
| Autori principali: | Priyanshu, Aman, Vijay, Supriti |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
di: Xie, Tinghao, et al.
Pubblicazione: (2024)
di: Xie, Tinghao, et al.
Pubblicazione: (2024)
The Silent Curriculum: How Does LLM Monoculture Shape Educational Content and Its Accessibility?
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language Models
di: Vijay, Supriti, et al.
Pubblicazione: (2025)
di: Vijay, Supriti, et al.
Pubblicazione: (2025)
Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems
di: Priyanshu, Aman, et al.
Pubblicazione: (2026)
di: Priyanshu, Aman, et al.
Pubblicazione: (2026)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
di: Yang, Lin, et al.
Pubblicazione: (2026)
di: Yang, Lin, et al.
Pubblicazione: (2026)
When Neutral Summaries are not that Neutral: Quantifying Political Neutrality in LLM-Generated News Summaries
di: Vijay, Supriti, et al.
Pubblicazione: (2024)
di: Vijay, Supriti, et al.
Pubblicazione: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026)
di: Liu, Junyu, et al.
Pubblicazione: (2026)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
di: Wan, Luanbo, et al.
Pubblicazione: (2025)
di: Wan, Luanbo, et al.
Pubblicazione: (2025)
Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks
di: Sinhamahapatra, Supriti, et al.
Pubblicazione: (2025)
di: Sinhamahapatra, Supriti, et al.
Pubblicazione: (2025)
TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
di: Akinode, Victor, et al.
Pubblicazione: (2026)
di: Akinode, Victor, et al.
Pubblicazione: (2026)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
di: Rahman, Salman, et al.
Pubblicazione: (2025)
di: Rahman, Salman, et al.
Pubblicazione: (2025)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
Adversarial Attacks and Defense for Conversation Entailment Task
di: Yang, Zhenning, et al.
Pubblicazione: (2024)
di: Yang, Zhenning, et al.
Pubblicazione: (2024)
AI Governance and Accountability: An Analysis of Anthropic's Claude
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
di: Gupta, Aman, et al.
Pubblicazione: (2025)
di: Gupta, Aman, et al.
Pubblicazione: (2025)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
di: Moore, Robert J., et al.
Pubblicazione: (2026)
di: Moore, Robert J., et al.
Pubblicazione: (2026)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)
di: Bai, Ge, et al.
Pubblicazione: (2024)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
di: Liu, Jiayu, et al.
Pubblicazione: (2025)
di: Liu, Jiayu, et al.
Pubblicazione: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
Bench4KE: Benchmarking Automated Competency Question Generation
di: Lippolis, Anna Sofia, et al.
Pubblicazione: (2025)
di: Lippolis, Anna Sofia, et al.
Pubblicazione: (2025)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
di: Hu, Xulin, et al.
Pubblicazione: (2026)
di: Hu, Xulin, et al.
Pubblicazione: (2026)
Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking
di: Creo, Aldan, et al.
Pubblicazione: (2025)
di: Creo, Aldan, et al.
Pubblicazione: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
di: Xie, Tinghao, et al.
Pubblicazione: (2024) -
The Silent Curriculum: How Does LLM Monoculture Shape Educational Content and Its Accessibility?
di: Priyanshu, Aman, et al.
Pubblicazione: (2024) -
Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language Models
di: Vijay, Supriti, et al.
Pubblicazione: (2025) -
Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems
di: Priyanshu, Aman, et al.
Pubblicazione: (2026) -
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)