Guardado en:
| Autores principales: | Bogdan, Alex, de Valois-Franklin, Adrian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.25634 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
por: Liang, Jiashuo, et al.
Publicado: (2024)
por: Liang, Jiashuo, et al.
Publicado: (2024)
Localizing Malicious Outputs from CodeLLM
por: Borana, Mayukh, et al.
Publicado: (2025)
por: Borana, Mayukh, et al.
Publicado: (2025)
LexiMark: Robust Watermarking via Lexical Substitutions to Enhance Membership Verification of an LLM's Textual Training Data
por: German, Eyal, et al.
Publicado: (2025)
por: German, Eyal, et al.
Publicado: (2025)
Machine Psychometrics: A Mathematical Psychology of Artificial Intelligence
por: Bogdan, Alex, et al.
Publicado: (2026)
por: Bogdan, Alex, et al.
Publicado: (2026)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
por: Zhang, Chiyu, et al.
Publicado: (2026)
por: Zhang, Chiyu, et al.
Publicado: (2026)
RealVul: Can We Detect Vulnerabilities in Web Applications with LLM?
por: Cao, Di, et al.
Publicado: (2024)
por: Cao, Di, et al.
Publicado: (2024)
Time Will Tell: Timing Side Channels via Output Token Count in Large Language Models
por: Zhang, Tianchen, et al.
Publicado: (2024)
por: Zhang, Tianchen, et al.
Publicado: (2024)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
FakeZero: Real-Time, Privacy-Preserving Misinformation Detection for Facebook and X
por: Essahli, Soufiane, et al.
Publicado: (2025)
por: Essahli, Soufiane, et al.
Publicado: (2025)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
por: Zhang, Anqi, et al.
Publicado: (2024)
por: Zhang, Anqi, et al.
Publicado: (2024)
One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety
por: Arif, Samee, et al.
Publicado: (2026)
por: Arif, Samee, et al.
Publicado: (2026)
LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in Cyber Threat Intelligence Credibility Verification
por: Tang, Fengxiao, et al.
Publicado: (2025)
por: Tang, Fengxiao, et al.
Publicado: (2025)
TimeMark: A Trustworthy Time Watermarking Framework for Exact Generation-Time Recovery from AIGC
por: Che, Shangkun, et al.
Publicado: (2026)
por: Che, Shangkun, et al.
Publicado: (2026)
LLM Reinforcement in Context
por: Rivasseau, Thomas
Publicado: (2025)
por: Rivasseau, Thomas
Publicado: (2025)
BadActs: A Universal Backdoor Defense in the Activation Space
por: Yi, Biao, et al.
Publicado: (2024)
por: Yi, Biao, et al.
Publicado: (2024)
Watermarking LLM Agent Trajectories
por: Meng, Wenlong, et al.
Publicado: (2026)
por: Meng, Wenlong, et al.
Publicado: (2026)
Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
por: Iyer, Karthik Raghu, et al.
Publicado: (2026)
por: Iyer, Karthik Raghu, et al.
Publicado: (2026)
Universal Zero-shot Embedding Inversion
por: Zhang, Collin, et al.
Publicado: (2025)
por: Zhang, Collin, et al.
Publicado: (2025)
Proactive defense against LLM Jailbreak
por: Zhao, Weiliang, et al.
Publicado: (2025)
por: Zhao, Weiliang, et al.
Publicado: (2025)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024)
por: Chen, Bocheng, et al.
Publicado: (2024)
TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts
por: Chu, Hua-Rong, et al.
Publicado: (2026)
por: Chu, Hua-Rong, et al.
Publicado: (2026)
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
por: Chang, Wenhan, et al.
Publicado: (2025)
por: Chang, Wenhan, et al.
Publicado: (2025)
LLM Anonymization Against Agentic Re-Identification
por: Li, Ziwen, et al.
Publicado: (2026)
por: Li, Ziwen, et al.
Publicado: (2026)
DAVE: A Policy-Enforcing LLM Spokesperson for Secure Multi-Document Data Sharing
por: Brinkhege, René, et al.
Publicado: (2026)
por: Brinkhege, René, et al.
Publicado: (2026)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
por: Zhang, Ruisi, et al.
Publicado: (2023)
por: Zhang, Ruisi, et al.
Publicado: (2023)
PRSA: Prompt Stealing Attacks against Real-World Prompt Services
por: Yang, Yong, et al.
Publicado: (2024)
por: Yang, Yong, et al.
Publicado: (2024)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
por: Liu, Junhao, et al.
Publicado: (2025)
por: Liu, Junhao, et al.
Publicado: (2025)
FunFuzz: An LLM-Powered Evolutionary Fuzzing Framework
por: Béjar, Mario Rodríguez, et al.
Publicado: (2026)
por: Béjar, Mario Rodríguez, et al.
Publicado: (2026)
On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning
por: Ye, Xiaotian, et al.
Publicado: (2026)
por: Ye, Xiaotian, et al.
Publicado: (2026)
GLiGuard: Schema-Conditioned Classification for LLM Safeguard
por: Zaratiana, Urchade, et al.
Publicado: (2026)
por: Zaratiana, Urchade, et al.
Publicado: (2026)
WorldCup Sampling for Multi-bit LLM Watermarking
por: Wang, Yidan, et al.
Publicado: (2026)
por: Wang, Yidan, et al.
Publicado: (2026)
Security Attacks on LLM-based Code Completion Tools
por: Cheng, Wen, et al.
Publicado: (2024)
por: Cheng, Wen, et al.
Publicado: (2024)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
por: Freenor, Michael, et al.
Publicado: (2025)
por: Freenor, Michael, et al.
Publicado: (2025)
Confidential Prompting: Privacy-preserving LLM Inference on Cloud
por: Li, Caihua, et al.
Publicado: (2024)
por: Li, Caihua, et al.
Publicado: (2024)
Multi-use LLM Watermarking and the False Detection Problem
por: Fu, Zihao, et al.
Publicado: (2025)
por: Fu, Zihao, et al.
Publicado: (2025)
Interpretable LLM Guardrails via Sparse Representation Steering
por: He, Zeqing, et al.
Publicado: (2025)
por: He, Zeqing, et al.
Publicado: (2025)
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
por: Wang, Junlin, et al.
Publicado: (2024)
por: Wang, Junlin, et al.
Publicado: (2024)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
por: Liu, Songyang, et al.
Publicado: (2026)
por: Liu, Songyang, et al.
Publicado: (2026)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
Gradual Verification for Smart Contracts
por: Sun, Haojia, et al.
Publicado: (2023)
por: Sun, Haojia, et al.
Publicado: (2023)
Ejemplares similares
-
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
por: Liang, Jiashuo, et al.
Publicado: (2024) -
Localizing Malicious Outputs from CodeLLM
por: Borana, Mayukh, et al.
Publicado: (2025) -
LexiMark: Robust Watermarking via Lexical Substitutions to Enhance Membership Verification of an LLM's Textual Training Data
por: German, Eyal, et al.
Publicado: (2025) -
Machine Psychometrics: A Mathematical Psychology of Artificial Intelligence
por: Bogdan, Alex, et al.
Publicado: (2026) -
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
por: Zhang, Chiyu, et al.
Publicado: (2026)