CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zhihao, Hu, Chenhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
di: Liu, Frank Weizhen, et al.
Pubblicazione: (2024)
di: Liu, Frank Weizhen, et al.
Pubblicazione: (2024)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
di: Jan, Essa, et al.
Pubblicazione: (2024)
di: Jan, Essa, et al.
Pubblicazione: (2024)
Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities
di: Nikitin, Alexander, et al.
Pubblicazione: (2024)
di: Nikitin, Alexander, et al.
Pubblicazione: (2024)
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
di: Guan, Zihan, et al.
Pubblicazione: (2025)
di: Guan, Zihan, et al.
Pubblicazione: (2025)
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
di: Kim, Seungone, et al.
Pubblicazione: (2023)
di: Kim, Seungone, et al.
Pubblicazione: (2023)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
A Framework to Implement 1+N Multi-task Fine-tuning Pattern in LLMs Using the CGC-LORA Algorithm
di: Song, Chao, et al.
Pubblicazione: (2024)
di: Song, Chao, et al.
Pubblicazione: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
XMoE: Sparse Models with Fine-grained and Adaptive Expert Selection
di: Yang, Yuanhang, et al.
Pubblicazione: (2024)
di: Yang, Yuanhang, et al.
Pubblicazione: (2024)
Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety
di: Mao, Junyu, et al.
Pubblicazione: (2025)
di: Mao, Junyu, et al.
Pubblicazione: (2025)
LongSafety: Enhance Safety for Long-Context LLMs
di: Huang, Mianqiu, et al.
Pubblicazione: (2024)
di: Huang, Mianqiu, et al.
Pubblicazione: (2024)
Bypassing Safety Guardrails in LLMs Using Humor
di: Cisneros-Velarde, Pedro
Pubblicazione: (2025)
di: Cisneros-Velarde, Pedro
Pubblicazione: (2025)
QEFT: Quantization for Efficient Fine-Tuning of LLMs
di: Lee, Changhun, et al.
Pubblicazione: (2024)
di: Lee, Changhun, et al.
Pubblicazione: (2024)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
di: Wang, Guoli, et al.
Pubblicazione: (2026)
di: Wang, Guoli, et al.
Pubblicazione: (2026)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs
di: Yang, Xikang, et al.
Pubblicazione: (2025)
di: Yang, Xikang, et al.
Pubblicazione: (2025)
Always Tell Me The Odds: Fine-grained Conditional Probability Estimation
di: Wang, Liaoyaqi, et al.
Pubblicazione: (2025)
di: Wang, Liaoyaqi, et al.
Pubblicazione: (2025)
Read the Scene, Not the Script: Outcome-Aware Safety for LLMs
di: Wu, Rui, et al.
Pubblicazione: (2025)
di: Wu, Rui, et al.
Pubblicazione: (2025)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
di: Schneider, Johannes
Pubblicazione: (2024)
di: Schneider, Johannes
Pubblicazione: (2024)
MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
di: Jain, Samyak, et al.
Pubblicazione: (2024)
di: Jain, Samyak, et al.
Pubblicazione: (2024)
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety
di: Shen, Qian, et al.
Pubblicazione: (2026)
di: Shen, Qian, et al.
Pubblicazione: (2026)
PocketLLM: Enabling On-Device Fine-Tuning for Personalized LLMs
di: Peng, Dan, et al.
Pubblicazione: (2024)
di: Peng, Dan, et al.
Pubblicazione: (2024)
Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning
di: Liu, Peiyuan, et al.
Pubblicazione: (2024)
di: Liu, Peiyuan, et al.
Pubblicazione: (2024)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
MolReFlect: Towards In-Context Fine-grained Alignments between Molecules and Texts
di: Li, Jiatong, et al.
Pubblicazione: (2024)
di: Li, Jiatong, et al.
Pubblicazione: (2024)
BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference
di: Jang, Wonsuk, et al.
Pubblicazione: (2025)
di: Jang, Wonsuk, et al.
Pubblicazione: (2025)
Certifying Knowledge Comprehension in LLMs
di: Chaudhary, Isha, et al.
Pubblicazione: (2024)
di: Chaudhary, Isha, et al.
Pubblicazione: (2024)
Simplify-This: A Comparative Analysis of Prompt-Based and Fine-Tuned LLMs
di: Cohen, Eilam, et al.
Pubblicazione: (2026)
di: Cohen, Eilam, et al.
Pubblicazione: (2026)
SAFT: Structure-Aware Fine-Tuning of LLMs for AMR-to-Text Generation
di: Kamel, Rafiq, et al.
Pubblicazione: (2025)
di: Kamel, Rafiq, et al.
Pubblicazione: (2025)
Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning
di: Goel, Jyotin, et al.
Pubblicazione: (2026)
di: Goel, Jyotin, et al.
Pubblicazione: (2026)
DEMO: Reframing Dialogue Interaction with Fine-grained Element Modeling
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
Aligning Large Language Models via Fine-grained Supervision
di: Xu, Dehong, et al.
Pubblicazione: (2024)
di: Xu, Dehong, et al.
Pubblicazione: (2024)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
di: Asif, Sadia, et al.
Pubblicazione: (2026)
di: Asif, Sadia, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
di: Liu, Frank Weizhen, et al.
Pubblicazione: (2024) -
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
di: Jan, Essa, et al.
Pubblicazione: (2024) -
Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities
di: Nikitin, Alexander, et al.
Pubblicazione: (2024) -
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
di: Guan, Zihan, et al.
Pubblicazione: (2025) -
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
di: Kim, Seungone, et al.
Pubblicazione: (2023)