Don't Say No: Jailbreaking LLM by Suppressing Refusal
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yukai, Lou, Jian, Huang, Zhijie, Qin, Zhan, Yang, Yibei, Wang, Wenjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures
por: Zhou, Yukai, et al.
Publicado: (2025)
por: Zhou, Yukai, et al.
Publicado: (2025)
What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts
por: Yang, Chenyang, et al.
Publicado: (2025)
por: Yang, Chenyang, et al.
Publicado: (2025)
R-Tuning: Instructing Large Language Models to Say `I Don't Know'
por: Zhang, Hanning, et al.
Publicado: (2023)
por: Zhang, Hanning, et al.
Publicado: (2023)
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
When Words Don't Mean What They Say: Figurative Understanding in Bengali Idioms
por: Sakhawat, Adib, et al.
Publicado: (2026)
por: Sakhawat, Adib, et al.
Publicado: (2026)
Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models
por: Xu, Yue, et al.
Publicado: (2024)
por: Xu, Yue, et al.
Publicado: (2024)
Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"
por: Madhwal, Dhruv, et al.
Publicado: (2026)
por: Madhwal, Dhruv, et al.
Publicado: (2026)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
por: Yu, Zhiyuan, et al.
Publicado: (2024)
por: Yu, Zhiyuan, et al.
Publicado: (2024)
What Language Models Know But Don't Say: Non-Generative Prior Extraction for Generalization
por: Rezaeimanesh, Sara, et al.
Publicado: (2026)
por: Rezaeimanesh, Sara, et al.
Publicado: (2026)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
por: Chen, Xinxi, et al.
Publicado: (2024)
por: Chen, Xinxi, et al.
Publicado: (2024)
RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs
por: Nguyen, Tuan T., et al.
Publicado: (2025)
por: Nguyen, Tuan T., et al.
Publicado: (2025)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
por: Deng, Yang, et al.
Publicado: (2024)
por: Deng, Yang, et al.
Publicado: (2024)
Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty
por: Ren, Jingyi, et al.
Publicado: (2026)
por: Ren, Jingyi, et al.
Publicado: (2026)
Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation
por: Parikh, Aditya, et al.
Publicado: (2026)
por: Parikh, Aditya, et al.
Publicado: (2026)
Don't Touch My Diacritics
por: Gorman, Kyle, et al.
Publicado: (2024)
por: Gorman, Kyle, et al.
Publicado: (2024)
Don't Trust: Verify -- Grounding LLM Quantitative Reasoning with Autoformalization
por: Zhou, Jin Peng, et al.
Publicado: (2024)
por: Zhou, Jin Peng, et al.
Publicado: (2024)
Do Retrieval Augmented Language Models Know When They Don't Know?
por: Zhou, Youchao, et al.
Publicado: (2025)
por: Zhou, Youchao, et al.
Publicado: (2025)
Don't Pay Attention
por: Hammoud, Mohammad, et al.
Publicado: (2025)
por: Hammoud, Mohammad, et al.
Publicado: (2025)
Say It Differently: Linguistic Styles as Jailbreak Vectors
por: Panda, Srikant, et al.
Publicado: (2025)
por: Panda, Srikant, et al.
Publicado: (2025)
Think, But Don't Overthink: Reproducing Recursive Language Models
por: Wang, Daren
Publicado: (2026)
por: Wang, Daren
Publicado: (2026)
Don't Throw Away Your Pretrained Model
por: Feng, Shangbin, et al.
Publicado: (2025)
por: Feng, Shangbin, et al.
Publicado: (2025)
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell
por: Lu, Taiming, et al.
Publicado: (2024)
por: Lu, Taiming, et al.
Publicado: (2024)
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
por: Lee, Joosung, et al.
Publicado: (2026)
por: Lee, Joosung, et al.
Publicado: (2026)
Reasoning Models Reason Well, Until They Don't
por: Rameshkumar, Revanth, et al.
Publicado: (2025)
por: Rameshkumar, Revanth, et al.
Publicado: (2025)
Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
por: Huang, Zemin, et al.
Publicado: (2025)
por: Huang, Zemin, et al.
Publicado: (2025)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
por: Wang, Ante, et al.
Publicado: (2025)
por: Wang, Ante, et al.
Publicado: (2025)
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
por: Hassid, Michael, et al.
Publicado: (2025)
por: Hassid, Michael, et al.
Publicado: (2025)
Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming
por: Kavumba, Pride, et al.
Publicado: (2026)
por: Kavumba, Pride, et al.
Publicado: (2026)
If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers
por: Hernandez, Adriano
Publicado: (2024)
por: Hernandez, Adriano
Publicado: (2024)
Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges
por: Li, Yanran
Publicado: (2026)
por: Li, Yanran
Publicado: (2026)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
por: Wang, Yuhang, et al.
Publicado: (2024)
por: Wang, Yuhang, et al.
Publicado: (2024)
Don't Throw Away Data: Better Sequence Knowledge Distillation
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency
por: Wang, Chenlong, et al.
Publicado: (2025)
por: Wang, Chenlong, et al.
Publicado: (2025)
Hatevolution: What Static Benchmarks Don't Tell Us
por: Di Bonaventura, Chiara, et al.
Publicado: (2025)
por: Di Bonaventura, Chiara, et al.
Publicado: (2025)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
por: Han, Seungju, et al.
Publicado: (2024)
por: Han, Seungju, et al.
Publicado: (2024)
LLM Cyber Evaluations Don't Capture Real-World Risk
por: Lukošiūtė, Kamilė, et al.
Publicado: (2025)
por: Lukošiūtė, Kamilė, et al.
Publicado: (2025)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Don't Half-listen: Capturing Key-part Information in Continual Instruction Tuning
por: He, Yongquan, et al.
Publicado: (2024)
por: He, Yongquan, et al.
Publicado: (2024)
Ejemplares similares
-
Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures
por: Zhou, Yukai, et al.
Publicado: (2025) -
What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts
por: Yang, Chenyang, et al.
Publicado: (2025) -
R-Tuning: Instructing Large Language Models to Say `I Don't Know'
por: Zhang, Hanning, et al.
Publicado: (2023) -
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025) -
When Words Don't Mean What They Say: Figurative Understanding in Bengali Idioms
por: Sakhawat, Adib, et al.
Publicado: (2026)