Measuring Copyright Risks of Large Language Model via Partial Information Probing
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Weijie, Shao, Huajie, Xu, Zhaozhuo, Duan, Suzhen, Zhang, Denghui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Token-wise Influential Training Data Retrieval for Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2024)
di: Lin, Huawei, et al.
Pubblicazione: (2024)
SoK: Large Language Model Copyright Auditing via Fingerprinting
di: Shao, Shuo, et al.
Pubblicazione: (2025)
di: Shao, Shuo, et al.
Pubblicazione: (2025)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
di: Gong, Yichen, et al.
Pubblicazione: (2023)
di: Gong, Yichen, et al.
Pubblicazione: (2023)
Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
di: Yang, Jirui, et al.
Pubblicazione: (2025)
di: Yang, Jirui, et al.
Pubblicazione: (2025)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
di: Shao, Hanyin, et al.
Pubblicazione: (2023)
di: Shao, Hanyin, et al.
Pubblicazione: (2023)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
di: Zhang, Jinchuan, et al.
Pubblicazione: (2025)
di: Zhang, Jinchuan, et al.
Pubblicazione: (2025)
Phare: A Safety Probe for Large Language Models
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
di: Lin, Guang, et al.
Pubblicazione: (2024)
di: Lin, Guang, et al.
Pubblicazione: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Resource Consumption Threats in Large Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
di: Yan, Yu, et al.
Pubblicazione: (2025)
di: Yan, Yu, et al.
Pubblicazione: (2025)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
di: Sun, Xiongtao, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
di: Luo, Zhifan, et al.
Pubblicazione: (2025)
di: Luo, Zhifan, et al.
Pubblicazione: (2025)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
Building Intelligence Identification System via Large Language Model Watermarking: A Survey and Beyond
di: Wang, Xuhong, et al.
Pubblicazione: (2024)
di: Wang, Xuhong, et al.
Pubblicazione: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Searching for Privacy Risks in LLM Agents via Simulation
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Token-wise Influential Training Data Retrieval for Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2024) -
SoK: Large Language Model Copyright Auditing via Fingerprinting
di: Shao, Shuo, et al.
Pubblicazione: (2025) -
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025) -
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025) -
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)