SVIP: Towards Verifiable Inference of Open-source Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yifan, Li, Yuhang, Zhang, Yue, Jin, Yuchen, Zhang, Huan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NANOZK: Layerwise Zero-Knowledge Proofs for Verifiable Large Language Model Inference
di: Wang, Zhaohui Geoffrey
Pubblicazione: (2026)
di: Wang, Zhaohui Geoffrey
Pubblicazione: (2026)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
di: Li, Xiao, et al.
Pubblicazione: (2024)
di: Li, Xiao, et al.
Pubblicazione: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
Was it Slander? Towards Exact Inversion of Generative Language Models
di: Skapars, Adrians, et al.
Pubblicazione: (2024)
di: Skapars, Adrians, et al.
Pubblicazione: (2024)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
di: Hua, Peichun, et al.
Pubblicazione: (2025)
di: Hua, Peichun, et al.
Pubblicazione: (2025)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
di: Xu, Yijie, et al.
Pubblicazione: (2025)
di: Xu, Yijie, et al.
Pubblicazione: (2025)
On the Role of Attention Heads in Large Language Model Safety
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks
di: Chen, Xiaoyi, et al.
Pubblicazione: (2023)
di: Chen, Xiaoyi, et al.
Pubblicazione: (2023)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
di: Bai, Yang, et al.
Pubblicazione: (2024)
di: Bai, Yang, et al.
Pubblicazione: (2024)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
SentinelLMs: Encrypted Input Adaptation and Fine-tuning of Language Models for Private and Secure Inference
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
FLClear: Visually Verifiable Multi-Client Watermarking for Federated Learning
di: Gu, Chen, et al.
Pubblicazione: (2025)
di: Gu, Chen, et al.
Pubblicazione: (2025)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Instructional Fingerprinting of Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
di: Tong, Xin, et al.
Pubblicazione: (2025)
di: Tong, Xin, et al.
Pubblicazione: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
Duwak: Dual Watermarks in Large Language Models
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
di: Bethany, Emet, et al.
Pubblicazione: (2024)
di: Bethany, Emet, et al.
Pubblicazione: (2024)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
Interpreting the Repeated Token Phenomenon in Large Language Models
di: Yona, Itay, et al.
Pubblicazione: (2025)
di: Yona, Itay, et al.
Pubblicazione: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
FIT to Forget: Robust Continual Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
di: Wu, Linyu, et al.
Pubblicazione: (2025)
di: Wu, Linyu, et al.
Pubblicazione: (2025)
SELF: A Robust Singular Value and Eigenvalue Approach for LLM Fingerprinting
di: Zhang, Hanxiu, et al.
Pubblicazione: (2025)
di: Zhang, Hanxiu, et al.
Pubblicazione: (2025)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
PostMark: A Robust Blackbox Watermark for Large Language Models
di: Chang, Yapei, et al.
Pubblicazione: (2024)
di: Chang, Yapei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
NANOZK: Layerwise Zero-Knowledge Proofs for Verifiable Large Language Model Inference
di: Wang, Zhaohui Geoffrey
Pubblicazione: (2026) -
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024) -
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
di: Li, Xiao, et al.
Pubblicazione: (2024) -
Adversarial Text Purification: A Large Language Model Approach for Defense
di: Moraffah, Raha, et al.
Pubblicazione: (2024) -
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)