No More, No Less: Least-Privilege Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rauba, Paulius, Seputis, Dominykas, Vanagas, Patrikas, van der Schaar, Mihaela |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models
par: Rauba, Paulius, et autres
Publié: (2025)
par: Rauba, Paulius, et autres
Publié: (2025)
The Fundamental Limits of Least-Privilege Learning
par: Stadler, Theresa, et autres
Publié: (2024)
par: Stadler, Theresa, et autres
Publié: (2024)
Tiny Autoregressive Recursive Models
par: Rauba, Paulius, et autres
Publié: (2026)
par: Rauba, Paulius, et autres
Publié: (2026)
Visualizing token importance for black-box language models
par: Rauba, Paulius, et autres
Publié: (2025)
par: Rauba, Paulius, et autres
Publié: (2025)
Quantifying perturbation impacts for large language models
par: Rauba, Paulius, et autres
Publié: (2024)
par: Rauba, Paulius, et autres
Publié: (2024)
Context-Aware Testing: A New Paradigm for Model Testing with Large Language Models
par: Rauba, Paulius, et autres
Publié: (2024)
par: Rauba, Paulius, et autres
Publié: (2024)
Self-Healing Machine Learning: A Framework for Autonomous Adaptation in Real-World Environments
par: Rauba, Paulius, et autres
Publié: (2024)
par: Rauba, Paulius, et autres
Publié: (2024)
Less Random, More Private: What is the Optimal Subsampling Scheme for DP-SGD?
par: Dong, Andy, et autres
Publié: (2026)
par: Dong, Andy, et autres
Publié: (2026)
Can In-Context Reinforcement Learning Recover From Reward Poisoning Attacks?
par: Sasnauskas, Paulius, et autres
Publié: (2025)
par: Sasnauskas, Paulius, et autres
Publié: (2025)
A No-Defense Defense Against Gradient-Based Adversarial Attacks on ML-NIDS: Is Less More?
par: elShehaby, Mohamed, et autres
Publié: (2026)
par: elShehaby, Mohamed, et autres
Publié: (2026)
No More, No Less: Task Alignment in Terminal Agents
par: Mavali, Sina, et autres
Publié: (2026)
par: Mavali, Sina, et autres
Publié: (2026)
Preventing Prompt Injection with Type-Directed Privilege Separation
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Trust the Process: Zero-Knowledge Machine Learning to Enhance Trust in Generative AI Interactions
par: Ganescu, Bianca-Mihaela, et autres
Publié: (2024)
par: Ganescu, Bianca-Mihaela, et autres
Publié: (2024)
Insufficient Statistics Perturbation: Stable Estimators for Private Least Squares
par: Brown, Gavin, et autres
Publié: (2024)
par: Brown, Gavin, et autres
Publié: (2024)
P3LS: Partial Least Squares under Privacy Preservation
par: Duy, Du Nguyen, et autres
Publié: (2024)
par: Duy, Du Nguyen, et autres
Publié: (2024)
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
par: Wallace, Eric, et autres
Publié: (2024)
par: Wallace, Eric, et autres
Publié: (2024)
Redefining Digital Health Interfaces with Large Language Models
par: Imrie, Fergus, et autres
Publié: (2023)
par: Imrie, Fergus, et autres
Publié: (2023)
Statistical Hypothesis Testing for Auditing Robustness in Language Models
par: Rauba, Paulius, et autres
Publié: (2025)
par: Rauba, Paulius, et autres
Publié: (2025)
Toward More Generalized Malicious URL Detection Models
par: Tsai, YunDa, et autres
Publié: (2022)
par: Tsai, YunDa, et autres
Publié: (2022)
ALPS: Automated Least-Privilege Enforcement for Securing Serverless Functions
par: Shin, Changhee, et autres
Publié: (2026)
par: Shin, Changhee, et autres
Publié: (2026)
Least Privilege Access for Persistent Storage Mechanisms in Web Browsers
par: Kancherla, Gayatri Priyadarsini, et autres
Publié: (2024)
par: Kancherla, Gayatri Priyadarsini, et autres
Publié: (2024)
Releasing Differentially Private Event Logs Using Generative Models
par: Wangelik, Frederik, et autres
Publié: (2025)
par: Wangelik, Frederik, et autres
Publié: (2025)
Less Effort, Shorter Proofs: Reinforcement Learning for Security Protocol Analysis in Tamarin
par: Cosler, Matthias, et autres
Publié: (2026)
par: Cosler, Matthias, et autres
Publié: (2026)
Visual CoT Makes VLMs Smarter but More Fragile
par: Xu, Chunxue, et autres
Publié: (2025)
par: Xu, Chunxue, et autres
Publié: (2025)
SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills
par: Wu, Jiangrong, et autres
Publié: (2026)
par: Wu, Jiangrong, et autres
Publié: (2026)
The More is not the Merrier: Investigating the Effect of Client Size on Federated Learning
par: Wallach, Eleanor, et autres
Publié: (2025)
par: Wallach, Eleanor, et autres
Publié: (2025)
Do Coding Agents Understand Least-Privilege Authorization?
par: Yan, Zheng, et autres
Publié: (2026)
par: Yan, Zheng, et autres
Publié: (2026)
DMS: Addressing Information Loss with More Steps for Pragmatic Adversarial Attacks
par: Zhu, Zhiyu, et autres
Publié: (2024)
par: Zhu, Zhiyu, et autres
Publié: (2024)
Output Perturbation for Differentially Private Convex Optimization: Faster and More General
par: Lowy, Andrew, et autres
Publié: (2021)
par: Lowy, Andrew, et autres
Publié: (2021)
Augmenting Parameter-Efficient Pre-trained Language Models with Large Language Models
par: Anand, Saurabh, et autres
Publié: (2026)
par: Anand, Saurabh, et autres
Publié: (2026)
Less is More: Understanding Word-level Textual Adversarial Attack via n-gram Frequency Descend
par: Lu, Ning, et autres
Publié: (2023)
par: Lu, Ning, et autres
Publié: (2023)
Provable Adversarial Robustness for Group Equivariant Tasks: Graphs, Point Clouds, Molecules, and More
par: Schuchardt, Jan, et autres
Publié: (2023)
par: Schuchardt, Jan, et autres
Publié: (2023)
Inexact Unlearning Needs More Careful Evaluations to Avoid a False Sense of Privacy
par: Hayes, Jamie, et autres
Publié: (2024)
par: Hayes, Jamie, et autres
Publié: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Less is more? Rewards in RL for Cyber Defence
par: Bates, Elizabeth, et autres
Publié: (2025)
par: Bates, Elizabeth, et autres
Publié: (2025)
Byzantine Failures Harm the Generalization of Robust Distributed Learning Algorithms More Than Data Poisoning
par: Boudou, Thomas, et autres
Publié: (2025)
par: Boudou, Thomas, et autres
Publié: (2025)
Backdooring Masked Diffusion Language Models
par: Cao, Daniel Yiming, et autres
Publié: (2026)
par: Cao, Daniel Yiming, et autres
Publié: (2026)
Prompt Obfuscation for Large Language Models
par: Pape, David, et autres
Publié: (2024)
par: Pape, David, et autres
Publié: (2024)
On Large Language Model Continual Unlearning
par: Gao, Chongyang, et autres
Publié: (2024)
par: Gao, Chongyang, et autres
Publié: (2024)
Signal Watermark on Large Language Models
par: Xu, Zhenyu, et autres
Publié: (2024)
par: Xu, Zhenyu, et autres
Publié: (2024)
Documents similaires
-
Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models
par: Rauba, Paulius, et autres
Publié: (2025) -
The Fundamental Limits of Least-Privilege Learning
par: Stadler, Theresa, et autres
Publié: (2024) -
Tiny Autoregressive Recursive Models
par: Rauba, Paulius, et autres
Publié: (2026) -
Visualizing token importance for black-box language models
par: Rauba, Paulius, et autres
Publié: (2025) -
Quantifying perturbation impacts for large language models
par: Rauba, Paulius, et autres
Publié: (2024)