A Domain-Based Taxonomy of Jailbreak Vulnerabilities in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Peláez-González, Carlos, Herrera-Poyatos, Andrés, Zuheros, Cristina, Herrera-Poyatos, David, Tejedor, Virilo, Herrera, Francisco |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An overview of model uncertainty and variability in LLM-based sentiment analysis. Challenges, mitigation strategies and the role of explainability
by: Herrera-Poyatos, David, et al.
Published: (2025)
by: Herrera-Poyatos, David, et al.
Published: (2025)
The H-Elena Trojan Virus to Infect Model Weights: A Wake-Up Call on the Security Risks of Malicious Fine-Tuning
by: Tejedor, Virilo, et al.
Published: (2025)
by: Tejedor, Virilo, et al.
Published: (2025)
Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework
by: Herrera-Poyatos, David, et al.
Published: (2025)
by: Herrera-Poyatos, David, et al.
Published: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
by: Peters, Sydney, et al.
Published: (2025)
by: Peters, Sydney, et al.
Published: (2025)
Credit C-GPT: A Domain-Specialized Large Language Model for Conversational Understanding in Vietnamese Debt Collection
by: Hong, Nhung Nguyen Thi, et al.
Published: (2026)
by: Hong, Nhung Nguyen Thi, et al.
Published: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
by: Fadli, Samih
Published: (2025)
by: Fadli, Samih
Published: (2025)
Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?
by: Fu, Tairan, et al.
Published: (2025)
by: Fu, Tairan, et al.
Published: (2025)
Precise Length Control in Large Language Models
by: Butcher, Bradley, et al.
Published: (2024)
by: Butcher, Bradley, et al.
Published: (2024)
Large Language Models for Biomedical Article Classification
by: Proboszcz, Jakub, et al.
Published: (2026)
by: Proboszcz, Jakub, et al.
Published: (2026)
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles
by: Budagam, Devichand, et al.
Published: (2024)
by: Budagam, Devichand, et al.
Published: (2024)
Beyond Demographics: Fine-tuning Large Language Models to Predict Individuals' Subjective Text Perceptions
by: Orlikowski, Matthias, et al.
Published: (2025)
by: Orlikowski, Matthias, et al.
Published: (2025)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
by: Collado-Montañez, Jaime, et al.
Published: (2025)
by: Collado-Montañez, Jaime, et al.
Published: (2025)
Strategy Adaptation in Large Language Model Werewolf Agents
by: Nakamori, Fuya, et al.
Published: (2025)
by: Nakamori, Fuya, et al.
Published: (2025)
Socially Responsible Data for Large Multilingual Language Models
by: Smart, Andrew, et al.
Published: (2024)
by: Smart, Andrew, et al.
Published: (2024)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
by: Ashuach, Tomer, et al.
Published: (2025)
by: Ashuach, Tomer, et al.
Published: (2025)
Large Language Models for Persian $ \leftrightarrow $ English Idiom Translation
by: Rezaeimanesh, Sara, et al.
Published: (2024)
by: Rezaeimanesh, Sara, et al.
Published: (2024)
Qomhra: A Bilingual Irish and English Large Language Model
by: McInerney, Joseph, et al.
Published: (2025)
by: McInerney, Joseph, et al.
Published: (2025)
Dialect Normalization using Large Language Models and Morphological Rules
by: Dimakis, Antonios, et al.
Published: (2025)
by: Dimakis, Antonios, et al.
Published: (2025)
Towards Human Understanding of Paraphrase Types in Large Language Models
by: Meier, Dominik, et al.
Published: (2024)
by: Meier, Dominik, et al.
Published: (2024)
RUQuant: Towards Refining Uniform Quantization for Large Language Models
by: Liu, Han, et al.
Published: (2026)
by: Liu, Han, et al.
Published: (2026)
Personality, Role, and Expressive Style in Large Language Models: An Interactionist Analysis
by: Nagao, Moe, et al.
Published: (2026)
by: Nagao, Moe, et al.
Published: (2026)
ConPET: Continual Parameter-Efficient Tuning for Large Language Models
by: Song, Chenyang, et al.
Published: (2023)
by: Song, Chenyang, et al.
Published: (2023)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
by: Zhao, Yong, et al.
Published: (2025)
by: Zhao, Yong, et al.
Published: (2025)
Robustness of Large Language Models to Perturbations in Text
by: Singh, Ayush, et al.
Published: (2024)
by: Singh, Ayush, et al.
Published: (2024)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
by: Garcia-Alcoser, Michael E., et al.
Published: (2025)
by: Garcia-Alcoser, Michael E., et al.
Published: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
by: Zhang, Peiyan, et al.
Published: (2025)
by: Zhang, Peiyan, et al.
Published: (2025)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
by: Dinh, Tu Anh, et al.
Published: (2024)
by: Dinh, Tu Anh, et al.
Published: (2024)
How Do Large Language Models Acquire Factual Knowledge During Pretraining?
by: Chang, Hoyeon, et al.
Published: (2024)
by: Chang, Hoyeon, et al.
Published: (2024)
LoRS: Efficient Low-Rank Adaptation for Sparse Large Language Model
by: Hu, Yuxuan, et al.
Published: (2025)
by: Hu, Yuxuan, et al.
Published: (2025)
German Text Simplification: Finetuning Large Language Models with Semi-Synthetic Data
by: Klöser, Lars, et al.
Published: (2024)
by: Klöser, Lars, et al.
Published: (2024)
LLM-Ref: Enhancing Reference Handling in Technical Writing with Large Language Models
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2024)
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2024)
Large Language Model (LLM) Bias Index -- LLMBI
by: Oketunji, Abiodun Finbarrs, et al.
Published: (2023)
by: Oketunji, Abiodun Finbarrs, et al.
Published: (2023)
Engineering A Large Language Model From Scratch
by: Oketunji, Abiodun Finbarrs
Published: (2024)
by: Oketunji, Abiodun Finbarrs
Published: (2024)
LinkNER: Linking Local Named Entity Recognition Models to Large Language Models using Uncertainty
by: Zhang, Zhen, et al.
Published: (2024)
by: Zhang, Zhen, et al.
Published: (2024)
When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models
by: Bae, Ji Ho
Published: (2026)
by: Bae, Ji Ho
Published: (2026)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
by: Yu, Jinzheng, et al.
Published: (2025)
by: Yu, Jinzheng, et al.
Published: (2025)
SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models
by: Liu, Han, et al.
Published: (2026)
by: Liu, Han, et al.
Published: (2026)
EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models
by: Gupta, Abhay, et al.
Published: (2025)
by: Gupta, Abhay, et al.
Published: (2025)
Effective and Efficient Schema-aware Information Extraction Using On-Device Large Language Models
by: Wen, Zhihao, et al.
Published: (2025)
by: Wen, Zhihao, et al.
Published: (2025)
Multi-Hierarchical Feature Detection for Large Language Model Generated Text
by: Zhang, Luyan, et al.
Published: (2025)
by: Zhang, Luyan, et al.
Published: (2025)
Similar Items
-
An overview of model uncertainty and variability in LLM-based sentiment analysis. Challenges, mitigation strategies and the role of explainability
by: Herrera-Poyatos, David, et al.
Published: (2025) -
The H-Elena Trojan Virus to Infect Model Weights: A Wake-Up Call on the Security Risks of Malicious Fine-Tuning
by: Tejedor, Virilo, et al.
Published: (2025) -
Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework
by: Herrera-Poyatos, David, et al.
Published: (2025) -
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
by: Peters, Sydney, et al.
Published: (2025) -
Credit C-GPT: A Domain-Specialized Large Language Model for Conversational Understanding in Vietnamese Debt Collection
by: Hong, Nhung Nguyen Thi, et al.
Published: (2026)