Shh, don't say that! Domain Certification in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Emde, Cornelius, Paren, Alasdair, Arvind, Preetham, Kayser, Maxime, Rainforth, Tom, Lukasiewicz, Thomas, Ghanem, Bernard, Torr, Philip H. S., Bibi, Adel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Certification of Uncertainty Calibration under Adversarial Attacks
par: Emde, Cornelius, et autres
Publié: (2024)
par: Emde, Cornelius, et autres
Publié: (2024)
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
par: Aichberger, Lukas, et autres
Publié: (2025)
par: Aichberger, Lukas, et autres
Publié: (2025)
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025)
par: Sneh, Jonathan, et autres
Publié: (2025)
Universal In-Context Approximation By Prompting Fully Recurrent Models
par: Petrov, Aleksandar, et autres
Publié: (2024)
par: Petrov, Aleksandar, et autres
Publié: (2024)
FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
par: Lin, Runqi, et autres
Publié: (2025)
par: Lin, Runqi, et autres
Publié: (2025)
OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage
par: Naik, Akshat, et autres
Publié: (2026)
par: Naik, Akshat, et autres
Publié: (2026)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
par: Lamb, Tom A., et autres
Publié: (2024)
par: Lamb, Tom A., et autres
Publié: (2024)
SoK: What don't we know? Understanding Security Vulnerabilities in SNARKs
par: Chaliasos, Stefanos, et autres
Publié: (2024)
par: Chaliasos, Stefanos, et autres
Publié: (2024)
BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
par: Blankenstein, Thierry, et autres
Publié: (2025)
par: Blankenstein, Thierry, et autres
Publié: (2025)
Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
par: Zhang, Wenxuan, et autres
Publié: (2024)
par: Zhang, Wenxuan, et autres
Publié: (2024)
CDC: Many teens say they don't receive emotional support, but parents say they do
par: Alison Knopf
Publié: (2024)
par: Alison Knopf
Publié: (2024)
TLS Certificate and Domain Feature Analysis of Phishing Domains in the Danish .dk Namespace
par: Pelekoudas, Athanasios P., et autres
Publié: (2026)
par: Pelekoudas, Athanasios P., et autres
Publié: (2026)
Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation
par: Yang, Yibo, et autres
Publié: (2024)
par: Yang, Yibo, et autres
Publié: (2024)
SimCS: Simulation for Domain Incremental Online Continual Segmentation
par: Alfarra, Motasem, et autres
Publié: (2022)
par: Alfarra, Motasem, et autres
Publié: (2022)
The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents
par: Wu, Baoyuan, et autres
Publié: (2026)
par: Wu, Baoyuan, et autres
Publié: (2026)
On Pretraining Data Diversity for Self-Supervised Learning
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
par: Alssum, Lama, et autres
Publié: (2025)
par: Alssum, Lama, et autres
Publié: (2025)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Efficient Error Certification for Physics-Informed Neural Networks
par: Eiras, Francisco, et autres
Publié: (2023)
par: Eiras, Francisco, et autres
Publié: (2023)
CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge
par: Keppler, Gustav, et autres
Publié: (2026)
par: Keppler, Gustav, et autres
Publié: (2026)
Prompting a Pretrained Transformer Can Be a Universal Approximator
par: Petrov, Aleksandar, et autres
Publié: (2024)
par: Petrov, Aleksandar, et autres
Publié: (2024)
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
par: Petrov, Aleksandar, et autres
Publié: (2023)
par: Petrov, Aleksandar, et autres
Publié: (2023)
A Symmetric-Key Cryptosystem Based on the Burnside Ring of a Compact Lie Group
par: Ghanem, Ziad
Publié: (2025)
par: Ghanem, Ziad
Publié: (2025)
Fool Me Once? Contrasting Textual and Visual Explanations in a Clinical Decision-Support Setting
par: Kayser, Maxime, et autres
Publié: (2024)
par: Kayser, Maxime, et autres
Publié: (2024)
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
par: Alhamoud, Kumail, et autres
Publié: (2024)
par: Alhamoud, Kumail, et autres
Publié: (2024)
A Robust Cross-Domain IDS using BiGRU-LSTM-Attention for Medical and Industrial IoT Security
par: Gueriani, Afrah, et autres
Publié: (2025)
par: Gueriani, Afrah, et autres
Publié: (2025)
Hybrid Online Certificate Status Protocol with Certificate Revocation List for Smart Grid Public Key Infrastructure
par: Huang, Hong-Sheng, et autres
Publié: (2024)
par: Huang, Hong-Sheng, et autres
Publié: (2024)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
par: ElZemity, Adel, et autres
Publié: (2025)
par: ElZemity, Adel, et autres
Publié: (2025)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
From Categories to Classifiers: Name-Only Continual Learning by Exploring the Web
par: Prabhu, Ameya, et autres
Publié: (2023)
par: Prabhu, Ameya, et autres
Publié: (2023)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
par: Kim, Minseon, et autres
Publié: (2025)
par: Kim, Minseon, et autres
Publié: (2025)
Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable
par: Liu, Haozhe, et autres
Publié: (2024)
par: Liu, Haozhe, et autres
Publié: (2024)
Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions
par: Kim, Hazel, et autres
Publié: (2024)
par: Kim, Hazel, et autres
Publié: (2024)
Exploring the Techniques of Information Security Certification
par: Chen, Abel C. H.
Publié: (2023)
par: Chen, Abel C. H.
Publié: (2023)
LLMs in Cybersecurity: Friend or Foe in the Human Decision Loop?
par: Pekaric, Irdin, et autres
Publié: (2025)
par: Pekaric, Irdin, et autres
Publié: (2025)
`Do as I say not as I do': A Semi-Automated Approach for Jailbreak Prompt Attack against Multimodal LLMs
par: Chiu, Chun Wai, et autres
Publié: (2025)
par: Chiu, Chun Wai, et autres
Publié: (2025)
Using LLMs for Tabletop Exercises within the Security Domain
par: Hays, Sam, et autres
Publié: (2024)
par: Hays, Sam, et autres
Publié: (2024)
Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
par: An, Bang, et autres
Publié: (2025)
par: An, Bang, et autres
Publié: (2025)
LLMs for Domain Generation Algorithm Detection
par: La O, Reynier Leyva, et autres
Publié: (2024)
par: La O, Reynier Leyva, et autres
Publié: (2024)
Data Certification Strategies for Blockchain-based Traceability Systems
par: Zonneveld, Giacomo, et autres
Publié: (2025)
par: Zonneveld, Giacomo, et autres
Publié: (2025)
Documents similaires
-
Towards Certification of Uncertainty Calibration under Adversarial Attacks
par: Emde, Cornelius, et autres
Publié: (2024) -
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
par: Aichberger, Lukas, et autres
Publié: (2025) -
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025) -
Universal In-Context Approximation By Prompting Fully Recurrent Models
par: Petrov, Aleksandar, et autres
Publié: (2024) -
FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
par: Lin, Runqi, et autres
Publié: (2025)